跳至正文

04 评论舆情

2026-10-07 当前设计按总 PRD先验证国内原帖与评论、相关性及时效性,情感和告警不是本次 POC 必须输出。下方保留历史能力状态和后续目标;本轮没有真实采集、模型或告警结果。

1. 要解决的问题

知道“发生了什么”之后,用户还想知道“大家怎么看”:评论在说什么、情感偏正面还是负面、负面有没有突然上升。

2. 功能

当前 POC 设计:

  • 在预算内从已选原帖采一级评论与可得回复,保留原帖、根线程、直接父评论/回复对象;缺父链、不可见与失败分开,不把未知父关系当一级评论。
  • 平台宣称评论总数、实际可读数、本轮新增数分别显示;记录热评/最新/默认排序、页数、上限、截断及真实抓取批次,不能把重读缓存当增量。
  • 评论无需复述关键词,结合原帖和可得父评论判断主题相关性;四档相关性与分析执行状态分开,情感可不执行,短回复信息不足则保留不足标签。
  • 旧帖新评论只针对已明确跟踪的帖子集合;不重置原帖发布时间或首次发现。重复消费、取消、父评论晚到与内容变化保留可核对关系。
  • 评论及分析均按所属用户读取,登录可见材料不自动公开,凭据不进入正文、模型或证据。用户能够展开上下文并打开原始出处。

数据库与契约需解耦现有“相关=true 必须有情感”的约束,见数据库设计;这仍是待实现差量。验收不把评论样本当全平台观点分布。以下为后续情感与持续监控需求:

  • 每小时增量采集主题命中帖子的评论(一级评论,加上能取到的二级回复),可以追溯到原帖和直接父评论。
  • 每小时对新内容做相关性判断、三分类情感(正面 / 中性 / 负面)和观点提取;每条观点都引用原文,数量和占比由程序按明确的分母计算。
  • 告警:“评论量一小时内突增”和“负面占比超过阈值”两条规则,每 5 分钟评估一次,有冷却期,站内通知。
  • 舆情看板:主题的声量趋势、情感分布、平台分布、代表评论,数字可以下钻到原帖和评论。

3. 做法

平台方式
Hacker News公开 API,已实现
B 站、微博、抖音、小红书及国内其余工作清单MediaCrawler  是本机候选,逐能力/版本验证;当前 B 站有桥接,其余不能由同一项目名称推断接通
X见 03 方案 B
Reddit只走官方 API + OAuth,需本人申请获批后再做
  • 情感和观点由本机 Codex app-server 生成(ai 领域已有适配器),每小时随采集批量运行。
  • 参考 BettaFish  的证据阅读和分析流程;当前 LICENSE 存在混合附加文本,本项目只参考、不复制代码,也不引入其模型或收费搜索路径。
  • MediaCrawler 使用自定义非商业学习研究许可,个人非商业不自动证明所有用途适用。微博可比较 MIT WeiboSpider;各候选的免费路径、许可和父链限制见GitHub 调研。
  • 当前 B 站评论读取搜索所留 JSONL;后续要用实际批次证明重新采集,不能仅凭有评论接口就声称旧帖回复持续刷新。

4. 现状

项状态
HN 评论与父链可用:两个账户有真实帖子和评论
B 站评论部分可用:代码在,修复后的真实采集未通过,开关关闭
微博、抖音、小红书评论未开始
情感与观点部分可用:字段与流程已实现,还没有用真实 Codex 跑出结果
告警规则部分可用:规则、冷却、重放边界已实现,没有真实触发过
舆情看板未开始

5. 验收标准

当前免费、父链、短回复、时间、去重与两轮增量按 POC 卡及验收场景执行,数值唯一来源是总 PRD。以下为历史舆情阶段标准;风控停止底线持续适用。

  1. HN、B 站、微博、抖音或小红书中至少 4 个平台,各有 ≥10 帖、≥50 条真实评论,并能追溯父链。
  2. 冻结 200 条样本(中文 150、英文 50)人工标注后评测:情感准确率 ≥85%,负面召回率 ≥85%,观点引用能直接支持观点的比例 ≥95%。
  3. 真实负面突增发生后,≤65 分钟内站内可见告警;冷却期内或重复处理时,不会重复通知。
  4. 任一登录平台出现验证码、登录失效或限流后,在本人人工恢复之前,新增请求为 0。

6. 不做什么

  • 不保证全量评论;单帖评论有上限,被截断的要明确标出。
  • 不用多账号、代理池或打码服务,不发评论、不私信。
  • 不识别图片和视频画面,也不转写音频。

验收记录

验收记录放在 records/ 目录下,文件元数据中的 capability 字段指向本文。目前还没有。

原始 Markdown