零代码手搓微博舆情系统:从采集到报告,一句代码没写
本期特邀嘉宾:不愿署名 带来一期AI编程实战。
AI 编程实战 · 用提示词搭一套能直接上手的舆情分析工具
动手之前,先交代两点本期实操中踩过的地方,能帮你少走一段弯路。一是 Cookie 会过期:微博登录态通常撑不了太久,脚本跑到一半开始返回空数据或跳回登录页时,先别怀疑代码,重新导出一次 Cookie 基本就能解决。二是别急着上量:第一次跑建议把页数压在 3~5 页,确认翻页、去重、字段对齐都正常了,再放开全量抓取,否则中途报错时你分不清是反爬拦了还是解析写错了。
还有个容易忽略的细节:同一批原始数据里,同一条博文可能因为转发或置顶在不同页重复出现,做统计之前最好先去重,不然热度曲线和 Top 榜容易被重复项带偏。这些都属于跑通之后才会遇到的问题,先放在正文之前提一句,后面看步骤时心里有数。
先说说为什么做这件事
所谓舆情分析,说穿了就是把公开信息抓回来、清洗干净、做统计、再加以研判,据此摸清舆论走向、找准关键节点、把握大众情绪。微博体量大、传播快,无论企业做品牌监测、部门研判公共事件,还是开展市场调研,它都是一座绕不开的数据富矿。
可现实是,热度稍高的话题动辄几百甚至上千条博文。全靠人工一条条复制、粘贴、计数,不但慢,漏掉的内容也很难察觉。到头来,干这行的人把大把精力耗在搬运数据上,真正用于研判结论的时间反被压缩了。
转机出现在近几年——以国产大模型为底座的 AI 编程工具,把开发门槛拉低了一大截。使用者不必掌握语法,只要用日常语言把需求讲清楚,工具就能生成可运行的代码。对那些需求零散、讲究定制的小工具而言,这相当于多了一条投入低、见效快的落地路径。
目标定在哪里
网页版微博虽然支持按关键词检索博文,但想靠人工把这些结果捋清楚,费时又费力。我们的思路是做一个程序:只要填入关注的话题关键词,它就能自动把相关博文尽数抓回,接着完成舆情数据分析,最后交出一份成型的舆情分析报告——整个过程无需写任何代码。抓取范围覆盖话题下每条博文的用户昵称、正文内容、发布时间,以及转发、评论、点赞三项互动数据。

老办法:靠人工搜关键词、逐条研判
动手之前,先把材料备齐
真正开工之前,有几样工具和材料得先备好:
Trae:一款带 AI 能力的编程 IDE,国内版可从 trae.com.cn 下载。它上手不算难,官方文档写得也细,这里不再展开。

Trae 下载页面
URL:用账号登录微博,随便搜一个关键词,把结果页的网址复制下来——这就是数据采集的入口。细看会发现网址有规律:page 参数跟着页码走,翻到第二页是 page=2,第三页是 page=3,依次递推。以后要抓别的网站数据,同样得先把待抓取的 URL 交给 AI。

以“俄乌战争”为关键词,第二页的 URL

同关键词第三页的 URL 长这样
Cookie:把登录状态下浏览器生成的 Cookie 取出来,脚本就能顶着登录态去取数。微博设有反爬机制,未登录直接访问指定页面会被拦下,所以要先拿到自己账号登录后的 Cookie,让 AI 凭它模拟登录,才能顺利拿到微博服务器返回的页面内容。



Cookie 的获取方式
项目落地
(1) 第一步:基础功能实现
别指望一次就做到位。先把核心功能做出来,后面再靠提示词一点点加料。在 Trae 里输入下面这段提示词:
“帮我写一个 Python 爬虫脚本,需要具备下面这些完整功能:
1. 读取并载入当前目录 cookie.txt 里保存的微博登录凭证,完成身份校验,以保证有权访问目标页面
2. 打开 “https://s.weibo.com/weibo?q=%E8%AE%BF%E5%8D%8E&page=2”,锁定页面里全部微博用户发布的博文条目
3. 对每条博文准确抓取这些核心数据:发布者昵称、发布时间、博文全文、转发数、评论数、点赞数
4. 为全部提取数据加上合理的异常处理:某条博文的某个字段抓取失败时记录为空值,不要中断整体抓取流程
5. 把请求与页面解析的等待时间设为 3-5 秒的随机间隔,模拟真人的浏览节奏,防止请求过密触发微博反爬而导致账号被封
6. 把提取到的结构化数据整理成规范表格,导出为 Excel 文件,表头与提取字段一一对应,保证存储后可读、可复用”
这段提示词其实交代了四件事:抓哪个页面(URL)、要哪些字段(昵称/时间/内容/转评赞)、存成什么格式(Excel)、以及要避开哪些坑(从 cookie 读登录态(cookie 值放在项目目录下的 cookie.txt 里)、控制抓取间隔防封号)。需求写得越具体,AI 生成的代码就越贴合实际场景,后续返工也越少。


Trae 生成的项目文件,以及抓取“访华”关键词后得到的数据
(2) 第二步:给基础功能做优化
初版只认固定的单页和固定关键词,也没有操作界面,因此要从三处下手:
全量数据获取:把分页规律摸透,让脚本自己逐页往下翻,直到把话题下的内容抓全。
任意关键词搜索:把关键词抽成参数,想查哪个话题就填哪个。
交互界面:搭一个可视化界面,关键词和 cookies 都由使用者自己填,不必再去动代码。
把这三条重新组织成提示词(具体见下图)。改完之后,在浏览器里打开 http://localhost:5000 即可直接使用。

用于功能优化的提示词

优化后的交互界面(关键词与抓取页数均可设置)
(3) 第三步:清洗数据
翻看抓回来的数据会发现,时间这一列五花八门:有“XX 分钟前”这种相对时间,有“XX 月 XX 日”这种简写,还有完整时间戳。必须先把它们统统转成 yyyy-MM-dd HH:mm:ss 这一种格式,同时清掉空值字段,否则接下来做时间热度分析,结果会失真。

抓回来的时间格式并不统一

用提示词完成时间格式处理

统一格式后的数据呈现
(4) 第四步:开展舆情分析
①时间热度分析
看看发帖集中在哪几天、哪个时段,并用折线把话题热度随日期的起伏画出来,从而锁定讨论最密集的“黄金时段”。

时间热度分析的提示词

话题热度随日期变化的走势
②互动数据分析
把点赞、评论、转发三项分别求和,再按转评赞总数排出前三名,连同发布者一并列出,高互动内容一眼就能挑出来。

转评赞总数 Top3 的爆款博文
③幕后推手
逐个统计用户的发帖次数并降序排列,取发布最频繁的前五名,那些疑似带节奏的账号也就浮出来了。

发帖频次 Top5 的活跃账号
④词云分析
让高频词以更大的字号呈现,谁被反复提及一目了然,核心议题也随之浮出水面。

上面这段提示词跑出来的词云结果
⑤情感分析
借助自然语言处理,逐条判定博文情绪属于正面、中性还是负面,再汇总出整体的情绪配比,据此判断舆论往哪边倒。

情感分析的底层原理

情感分析结果(正面 · 中性 · 负面占比)
把分析结果汇成报告
把前面各项分析结果归拢到一起,由 AI 直接产出一份围绕该关键词的舆情分析报告——热度走势、爆款博文、活跃账号、词云、情感分布,该有的都有。

一键生成的简易舆情分析报告
相比传统舆情系统,亮点在哪
过去做舆情分析基本只有两条路:一是人工逐条搜、逐条抄、逐条算;二是掏钱买商业舆情平台的服务。这套手搓出来的系统介于两者之间,最大的价值在于——原本需要一个专业团队才能撑起来的能力,现在靠零代码就能自己搭出来。下面沿“采集、分析、预警、呈现”四条线分别说。
(1) 采集:由“人工搬数据”转为“全自动持续监测”
人工的老办法是一页页搜、一条条复制,慢且容易漏;商业平台虽能自动采集,口径却被平台框死,你说了不算。这套系统的好处正在于采集范围由自己定,而且能长时间自动运行。
全量自动翻页:一个话题下的博文一次抓完,省去逐页复制;
定时 + 增量抓取:设定好频率自动执行,只取新增部分,把“抓一次”变成“长期盯着”;
任意 / 多关键词:关注什么就填什么,多个关键词还能并行监测;
评论采集:评论区一并抓回,信息量比只看主帖大得多。

定时抓取 · 数据不断累积
(2) 分析:由“人工粗算”转为“多维深度研判”
人工顶多把转评赞数一数,商业平台的标配维度也谈不上深入。而这里只要写一段提示词,分析的深度就能再往下走一层。
时间热度趋势:话题何时最热,一眼看清;
情感分析 + 趋势曲线:既能看总体情绪,也能看它如何演变、在哪个节点“翻车”;
互动 Top3 + KOL 识别:既找爆款内容,也找真正带节奏的关键账号;
词云 + 主题聚类:争议集中在哪几个点上,快速抓住。

情感占比随时间的变化

主题聚类 · 观点归类

KOL 影响力榜
(3) 预警:由“被动查看”转为“主动提醒”
老办法要么安排人一直守着屏幕,要么等事情闹大了才反应过来。这套系统让程序自己去发现问题,然后反过来找你。
舆情预警:预设阈值,声量突增或负面骤升时自动推提醒(邮件/飞书/企微);
竞品对比监测:自身与竞品同时盯着,声量随时比对;
事件溯源:最快定位最早的源头与引爆点。

声量越过阈值即自动预警(示意图)
(4) 呈现:由“零散数据”转为“大屏与报告”
人工算完还得自己攒 PPT、写报告;这套系统直接把结果变成可以拿去汇报的成品。
可视化大屏:趋势、词云、情感、榜单集于一屏,拿来就能投;
交互式筛选:可按时间、关键词、情感类型层层下钻;
多格式报告:Word/PDF/PPT 自动成文,不必再手工整理。

舆情监测可视化大屏
说到底,这套手搓系统的价值就一句话:过去要凑齐“采集 + 分析 + 可视化”一支专业队伍才能推进的事,如今一个人、不写代码,就能跑通。
写在最后
AI 编程真正的意义,是把“搭工具”从专业开发的专属能力,变成对业务需求的清晰描述——只要熟悉业务、哪怕不懂代码,也能很快搭出自用的分析工具。
用 AI 生成爬虫程序,有两点务必留意:
其一是合规:抓取行为要守目标平台的用户协议,控制请求频率、别给服务器添负担;涉及个人信息处理的,须符合《个人信息保护法》的要求,且仅用于合法合规的分析目的;
其二是 AI 产出的内容终归只是辅助,关键结论仍需回到原始数据中复核确认。


敬请各位大佬关注:小谢取证


扫取二维码获取
更多精彩
小谢取证
