
几行命令搞定B站评论爬虫批量获取完整一二级评论并导出CSV新手也能轻松上手【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper深夜刷到一个爆款视频评论区吵得热火朝天你想看看大家对某个争议点的真实看法。可你从第一条翻到最后一条手指都滑酸了能看到的也就二三十条——剩下成千上万条评论被加载更多死死挡在后面连那些动辄几百条回复的楼中楼也只露出一小截。如果你还想过把这些评论存下来做分析手动复制粘贴更是想想都头大。这种情况正是今天要介绍的BilibiliCommentScraper要解决的它是一款开源的B站评论爬虫能一口气把视频下所有可见的一级评论、二级评论连同它们的层级关系完整抓下来并导出为结构清晰的 CSV 文件。换句话说批量获取B站评论从此不再是程序员的专属技能几行命令新手也能跑通。深夜刷视频的抓狂瞬间评论明明很精彩你却只能看到二十几条先讲个更具体的场景。有位做医疗科普的 UP 主朋友上传了一条讲肾结石的视频播放量一夜破百万。评论区里有人分享亲身经历、有人追问细节、还有人互相回复补充信息——这些内容对他来说就是最宝贵的选题灵感库。但他很快发现两件烦心事评论区深不见底网页只默认加载前几十条想看完剩下的得不停地往下滚、不停地点查看全部回复手点到抽筋。层级关系全乱了一条热评下面挂着几百条回复回复里还套着回复。他想要的谁回复了谁、这条楼中楼有多火光靠肉眼根本理不清。如果你也遇到过类似情况那么恭喜你你已经被评论数据获取这个经典难题绊倒过了。而 BilibiliCommentScraper 的思路很简单模拟真人浏览网页把能看到的评论全部记下来再按原样整理成表格。它不是去猜数据而是眼见为实地采集所以连二级评论这种最容易丢的层级也能保住。它是怎么全都要的用生活常识理解爬虫原理不用慌理解这个工具不需要懂太多技术把它想象成一个不知疲倦的代刷手机的人就行。一级评论与二级评论一场楼下对话的层级关系B站的评论区可以粗分成两层一级评论直接发在视频底下的话相当于聚会里的主发言。二级评论回复一级评论的内容相当于楼下有人接着聊而这条回复又可能被更多人继续回复。很多工具只能抓到第一层BilibiliCommentScraper 则会像真人一样先滑到底把一级评论都加载出来再逐条点开查看全部回复把每一层对话都翻个底朝天。最后输出时每条数据都会带一个隶属关系标记告诉你它是哪一级、回复的是谁层级结构一目了然后续做 B站评论数据分析时想怎么切都行。断点续爬像书签一样合上书也不会丢进度它最贴心的一点是断点续爬。爬虫每处理完一部分就会把进度写进同目录下的progress.txt文件——你可以把它理解成一枚自动插进书里的书签。万一你中途关了电脑、网络断掉、或者不小心把浏览器关了下次重新运行它会自动翻开书签接着爬已经写完的 CSV 也会接着往下写绝不白跑。这对评论量动辄上万的热门视频特别友好让它在后台自己爬一整晚第二天早上醒来数据已经整整齐齐躺好了。为什么不用官方接口因为要眼见为实有人会问B站不是有现成的接口吗直接调 API 不是更快作者选择用 Selenium 模拟浏览器恰恰是为了数据更全面、更接近你亲眼看到的评论区。接口能拿到的字段往往有限而浏览器里能看到什么这个工具就能采到什么连发布时间、点赞数、用户 ID 这些细节都一并收录。十分钟极速上手从安装依赖到看到第一份CSV空谈原理不如动手跑一遍。我们用一个真实视频来演示——假设你想采集这条视频的评论https://www.bilibili.com/video/BV17M41117eg这只是示例你可以换成任意想分析的视频。第一步安装 Python 与依赖库确保电脑上装了Python 3然后在命令行里执行pip install selenium beautifulsoup4 webdriver-managerselenium负责操控浏览器、模拟真人滚动和点击beautifulsoup4负责解析页面、提取评论字段webdriver-manager自动帮你管理浏览器驱动省去手动下载的麻烦。第二步把视频链接写进 video_list.txt在项目根目录找到或新建video_list.txt文件每行写一个视频链接https://www.bilibili.com/video/BV17M41117eg https://www.bilibili.com/video/BV1QF411q73H https://www.bilibili.com/video/BV1c14y147g6想批量采集多个视频往这个文件里多贴几行就行程序会挨个处理每个视频单独生成一个以视频 ID 命名的 CSV 文件互不干扰。第三步扫码登录一次剩下的交给脚本在项目目录下运行python Bilicomment.py第一次运行时程序会弹出一个浏览器窗口并在控制台提示你登录。你只需要扫码登录一次登录状态会自动保存到同目录下的cookies.pkl文件里。以后每次运行都会自动带上这份通行证再也不用重复登录。如果哪天登录失效了删掉cookies.pkl重新登录一次即可。第四步等待片刻收获 CSV 成果之后就是等待。程序会一边滚动页面一边采集控制台会实时打印进度。跑完后在代码文件同目录下你会看到类似BV17M41117eg.csv这样的文件——用 Excel 或任意文本编辑器打开你的第一份完整评论数据集就到手了。导出的数据到底长什么样字段含义与层级结构一次讲清打开 CSV你会看到每一行是一条评论每一列是一个字段。完整字段如下字段含义一级评论计数这条评论归属哪条一级评论第几条隶属关系标记为一级评论或二级评论被评论者昵称 / 被评论者ID它回复的是谁一级评论显示up主昵称 / 用户ID这条评论的作者是谁评论内容评论原文发布时间精确到分钟的时间戳点赞数这条评论收获的点赞数量下面这张截图就是真实的采集结果示例能看到隶属关系把一层层对话分得清清楚楚昵称、用户ID、发布时间、点赞数一应俱全有了这样一张结构化的表后面的 B站评论数据分析就轻松多了——排序、筛选、统计点赞最高的评论都是一两下点击的事。这些评论数据能用来做什么三类人的真实用法数据拿到手关键是怎么用。分享三个身边的真实案例 内容创作者把评论区变成免费选题库视频发出去后评论区就是最真实的观众反馈。哪类话题讨论最热烈、观众在追问什么、哪些点被反复提及用爬下来的数据按点赞数排序一眼就能看出观众真正想要的内容。我那位做科普的朋友就是从评论里筛出高频问题连做了三期评论区答疑视频播放量都远超平均线。 学术研究者让情感分析、社群研究有据可依论文需要真实数据做支撑时最怕样本不全。有了完整的评论数据集可以按发布时间做话题演化分析按用户 ID 追踪核心用户甚至把评论内容清洗后做情感倾向分析——一份带层级关系、字段完整的数据集能省去大量手工整理的时间。 运营与产品分析者低成本洞察用户口碑无论是监测自家产品视频下的舆论风向还是分析竞品视频下用户吐槽的集中点这套流程都能用上。把几个相关视频的评论都爬下来汇总进一个表里做词频统计比一个个翻评论区高效太多而且全程数据都在本地不用担心隐私外泄。进阶技巧与避坑指南老用户踩过的坑帮你提前绕开工具好用但有些细节提前知道能少走很多弯路。这里整理成技巧 坑点的形式️ 技巧一按需调节爬取规模在Bilicomment.py里有两个关键参数可以调MAX_SCROLL_COUNT 45 # 最大滚动次数默认45次预计最多爬取约920条一级评论 max_sub_pages 150 # 二级评论最大翻页数设为None表示不限制评论量小的视频用默认值就够碰到 10 万 评论的超热门视频建议适当调小这两个值避免页面加载数据过多导致浏览器崩溃。记住内存不是无限的宁可分批爬也别一次贪多。️ 技巧二给请求加一点随机延时爬得太快容易被平台盯上。想让程序更礼貌可以在代码里加入随机延时让每次请求间隔 1 到 5 秒不等import random time.sleep(random.uniform(1, 5)) # 随机生成1到5秒之间的延时这个技巧特别适合处理热门视频或需要长时间运行的场景能明显降低触发验证码的概率。️ 技巧三用 progress.txt 精准控制进度想跳过某个视频、或者从特定位置继续直接编辑progress.txt即可。它的内容是一行 JSON例如{video_count: 1, first_comment_index: 15, sub_page: 114, write_parent: 1}含义是第 1 个视频已爬完当前在第 2 个视频、第 15 条一级评论、二级评论翻到了第 114 页。想跳过当前视频把video_count加 1想从头开始删掉这个文件即可。注意三个数字都是从 0 开始计数的。⚠️ 坑点一Excel 打开 CSV 乱码CSV 文件是 UTF-8 编码部分版本的 Excel 直接双击打开会乱码。解决方法是用记事本等文本编辑器打开查看或者在 Excel 里用数据 → 从文本/CSV 导入并选择 UTF-8 编码。用 pandas 等工具直接读取也完全没问题。⚠️ 坑点二单元格报错显示 $NAME?如果某个单元格内容以-开头比如昵称叫-GhausterExcel 可能把它误判成公式而报错。这是 Excel 的锅不是数据的问题忽略或改一下单元格格式即可。⚠️ 坑点三报错 Permission denied多半是某个文件被占用了——比如你正用 Excel 开着正在写入的 CSV或手动打开了progress.txt。关掉相关程序再运行或者以管理员身份运行脚本基本都能解决。 关于合规说句实在话爬虫工具本身是中性的用得好不好全看人。建议始终做到三点只采集公开可见的评论数据、合理控制请求频率不给平台添堵、数据仅用于个人学习与研究。尊重平台规则和用户隐私这条路才能走得长远。最后一步去下载它跑通你的第一个数据集看到这里你已经掌握了 B站评论爬虫的核心玩法填好video_list.txt登录一次运行python Bilicomment.py然后收获一份字段完整、层级清晰的 CSV 评论数据集。整个过程不需要会写代码理解原理后甚至还能自己调整参数玩出更多花样。现在就动手试试git clone https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper.git cd BilibiliCommentScraper pip install selenium beautifulsoup4 webdriver-manager把你最感兴趣的视频链接写进video_list.txt运行python Bilicomment.py去感受一下批量获取B站评论原来可以这么省心。跑通之后不妨再看看源码里那些注释——作者把踩过的坑都写在了里面说不定下一个改进点就由你贡献。毕竟在数据驱动的时代谁能高效拿到数据谁就赢在了起跑线上。祝你爬得顺利分析得开心【免费下载链接】BilibiliCommentScraperB站视频评论爬虫 Bilibili完整爬取评论数据包括一级评论、二级评论、昵称、用户ID、发布时间、点赞数项目地址: https://gitcode.com/gh_mirrors/bi/BilibiliCommentScraper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考