ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件

B站数据导出教程:用InfoSpider把观看历史与账号信息存成JSON文件 B站数据导出教程用InfoSpider把观看历史与账号信息存成JSON文件【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱旨在安全快捷的帮助用户拿回自己的数据工具代码开源流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpiderInfoSpider 是一个开源的本地数据爬虫工具箱选中其中的哔哩哔哩数据源后程序会把你的B站观看历史和个人资料抓下来写成本机上的 JSON 文件完成一次完整的 B站数据导出与账号资料备份全程无需手写任何抓取代码。导出完成后你会得到什么在开始操作前先看清楚这次B站数据导出最终落到磁盘里的东西文件名里面装了什么bilibili_history.json你的观看历史视频标题、BV 号、播放时间点等按每页 200 条分页最多抓取 10 页约最近 2000 条user_info.json账号基础资料昵称、头像、签名、等级、粉丝数等信息两个文件都是 UTF-8 编码的标准 JSON用文本编辑器就能直接打开也能丢进 pandas 之类的工具做后续分析。什么时候需要把B站数据拿出来想复盘自己前两年看过什么内容却发现历史记录页只能往前翻最近几十条视频陆续下架之后连自己到底收藏过哪些方向都说不清楚了把这两份 JSON 存下来这些问题就有了兜底。最小化环境要求Python 3.6 以上并安装 Chrome 浏览器含与浏览器同版本的驱动拉取项目并装好依赖即可git clone https://gitcode.com/GitHub_Trending/in/InfoSpider cd InfoSpider pip3 install -r requirements.txt完整操作流程整条链路是运行主程序 → 点击哔哩哔哩数据源 → 浏览器里扫码登录 → 选保存文件夹 → 等待导出。第一步在弹出的浏览器里扫码完成免密登录在 InfoSpider 主界面的数据源列表里点击哔哩哔哩程序会自动打开一个浏览器窗口并停在B站登录页。这一步不需要输入账号密码掏出手机用哔哩哔哩 APP 扫一下页面上的二维码、在手机上确认即可登录跳转完成的瞬间程序就会带着你的登录凭证进入抓取环节。第二步选择存放B站备份文件的本地文件夹登录成功后会弹出选择信息保存文件夹对话框。建议新建一个空目录比如bilibili_backup专门放这些文件选好之后点选择文件夹确认如果点了取消程序会直接退出且不产生任何文件。第三步等待观看历史导出并核对结果确认路径后程序开始逐页请求B站接口每页间隔约 1 秒页面上会持续打印爬取中...。当出现爬取完成...后回到你选的文件夹应该能看到 bilibili_history.json 与 user_info.json 两个文件。拿到文件之后怎么做想看历史明细用任意编辑器打开 bilibili_history.json按页查看视频标题和 BV 号即可。想进一步处理用 pandas 读取后可以统计自己观看的时段分布或关注过的内容方向。备份习惯建议每个月跑一次文件不大本地和云盘各留一份最稳妥。常见坑点扫码窗口没弹出或浏览器闪退→ 多为 Chrome 未装或与驱动版本不匹配 → 确认浏览器和驱动版本一致后重跑。保存文件夹里一个文件都没有→ 选择文件夹对话框点了取消 → 重新运行并确认选择目录。历史记录条数比预期少→ 程序只往前抓最近 10 页约 2000 条→ 属于设计上限核对 JSON 实际条数即可。JSON 打开是乱码→ 编辑器默认编码不是 UTF-8 → 切换为 UTF-8 后重新打开。关于隐私整个过程都在你自己的机器上发生程序读取扫码后的登录凭证直接向B站发起请求结果文件只写进你选的本地目录数据不经过任何第三方服务器全程也没有要求你输入密码。结语观看历史和账号资料同样是你的数字资产把它们从网页里搬进自己的文件才算真正把数据握在手中。有空花几分钟给账号做一次备份下次想复盘时资料就在手边。InfoSpider 的B站抓取逻辑见 Spiders/bilibili/main.py更多数据源可以翻 docs/QuickStart.md 继续了解。【免费下载链接】InfoSpiderINFO-SPIDER 是一个集众多数据源于一身的爬虫工具箱旨在安全快捷的帮助用户拿回自己的数据工具代码开源流程透明。支持数据源包括GitHub、QQ邮箱、网易邮箱、阿里邮箱、新浪邮箱、Hotmail邮箱、Outlook邮箱、京东、淘宝、支付宝、中国移动、中国联通、中国电信、知乎、哔哩哔哩、网易云音乐、QQ好友、QQ群、生成朋友圈相册、浏览器浏览历史、12306、博客园、CSDN博客、开源中国博客、简书。项目地址: https://gitcode.com/GitHub_Trending/in/InfoSpider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表