资讯中心

MediaCrawler-new 实战指南:1 小时上手五大平台数据采集,新手也能一学就会

📅 2026/8/20 21:59:24
MediaCrawler-new 实战指南:1 小时上手五大平台数据采集,新手也能一学就会
MediaCrawler-new 实战指南1 小时上手五大平台数据采集新手也能一学就会【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new小陈刚入职新媒体运营岗领导丢给她一个任务把小红书上露营相关的热门笔记整理成表格。她一条条复制粘贴两小时只整理了 30 条眼睛发酸。这种被社交媒体数据采集反复折磨的场景每天都在无数打工人身上重演。而MediaCrawler-new这个开源爬虫框架就是来终结这种体力活的——它用一套 Python 代码自动抓取小红书、抖音、快手、B 站、微博五大平台的帖子、视频与评论是真正意义上的一站式社交媒体数据采集工具。一页看懂它到底是什么一句话一个用 playwright 模拟真实浏览器操作的爬虫框架把打开网页、手动翻页、复制粘贴变成一条命令、自动保存。它解决三个痛点平台反爬太严、登录验证太烦、IP 封得太快。框架用真实浏览器环境绕过大部分反爬五种平台共用一个配置入口改一行PLATFORM就能切换目标平台数据按你的选择存成 CSV、JSON 或直接入库。跑通一件事30 分钟搞定小红书关键词采集从零到一我们只演示最常用的关键词搜索采集场景。第 1 步5 分钟搭好环境git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler-new cd MediaCrawler-new python -m venv venv source venv/bin/activate # Windows 用 venv\Scripts\activate pip install -r requirements.txt playwright install动手前先确认系统里有 Node.jsv16.8.0playwright 离不开它。第 2 步3 分钟改三行配置打开config/base_config.py只需动三处PLATFORM xhs # 目标平台xhs / dy / ks / bili / wb KEYWORDS 露营,帐篷 # 要搜索的关键词 SAVE_DATA_OPTION json # 数据存成 json也可选 csv / db第 3 步扫码开跑python main.py --platform xhs --lt qrcode --type search浏览器自动弹出二维码手机小红书 App 扫一下爬虫立刻开工。默认抓取 20 条笔记标题、正文、点赞、评论数一应俱全结果落在data/目录。从手动复制两小时到一条命令十分钟这就是差距。两个点睛亮点亮点一登录一次之后免登录很多爬虫每次运行都要重新扫码烦不烦MediaCrawler-new 会把登录态缓存进本地浏览器目录今天登录一次明天直接跑命令接着爬无需二次认证。对每天定时采集的用户来说省下的不只是几秒而是流程不断被打断的烦躁感。亮点二内置代理 IP 池防封号更省心采集量大时最怕 IP 被平台拉黑。项目内置了一套代理 IP 管理系统像快递中转站帮你隐藏真实地址自动从服务商拉取 IP → 存入 Redis → 汇成代理池 → 爬虫按需轮换。![MediaCrawler-new 代理IP池工作流程图展示IP拉取缓存分配全流程](https://raw.gitcode.com/GitHub_Trending/me/MediaCrawler-new/raw/387f08701788e8e626b688ecf6ef50f669a80b75/static/images/代理IP 流程图.drawio.png?utm_sourcegitcode_repo_files)用起来很简单把ENABLE_IP_PROXY设为 True再用IP_PROXY_POOL_COUNT控制池子大小。想对接自己的代理服务商项目已写好示例密钥从环境变量读取而非写死在代码里参考proxy/proxy_ip_provider.py和下图即可。避坑经验谈你可能踩的 3 个坑报缺少 nodejs 环境别慌装一个 Node.js v16.8.0 就好这是 playwright 的硬性依赖。playwright 安装或连接超时多半是网络问题检查网络和代理设置确认能正常访问目标平台后再重试。扫码后没反应或登录失败删掉browser_data/目录重新登录如果卡在滑块验证把HEADLESS改成 False让浏览器窗口弹出来手动滑一次验证码通常就能过。还能怎么玩跑通基础场景后这些玩法同样值得一试B 站批量视频下载把CRAWLER_TYPE设为 video_download一次拉一批视频数据入库分析SAVE_DATA_OPTION改成 db配合 config/db_config.py 写入 MySQL / PostgreSQL手机号验证码登录不习惯扫码详见 docs/手机号登录说明.md指定内容精采填好帖子 ID 列表后切换 detail 模式精准抓某几条内容更多报错解法集中在 docs/常见问题.md遇到问题先去翻一翻。现在轮到你动手了收好这份三步行动清单克隆项目、装好环境把上面的小红书关键词采集完整跑一遍约 30 分钟把KEYWORDS换成你所在行业的热词数据存成 CSV用 Excel 打开看看再换个平台dy 或 bili跑一次对比不同平台的数据字段差异。最后提醒请遵守各平台规则与法律法规只采集公开数据、控制请求频率数据仅用于合法的学习与研究别拿来搞恶意爬取。数据不该是复制粘贴的体力活。把重复工作交给 MediaCrawler-new把时间留给真正需要你判断力的事——现在就打开终端跑通你的第一条采集命令吧。【免费下载链接】MediaCrawler-new项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler-new创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考