---
type: capability
title: 评论舆情
summary: 当前验证免费评论取样、父链、相关性和增量；情感、观点、告警与看板后置
status: 部分可用
release: [V1, V2]
kr: [KR2, KR3, KR4]
updated: 2026-10-07
---

# 04 评论舆情

2026-10-07 当前设计按[总 PRD](../product/prd/01-PRD.md)先验证国内原帖与评论、相关性及时效性，情感和告警不是本次 POC 必须输出。下方保留历史能力状态和后续目标；本轮没有真实采集、模型或告警结果。

## 1. 要解决的问题

知道“发生了什么”之后，用户还想知道“大家怎么看”：评论在说什么、情感偏正面还是负面、负面有没有突然上升。

## 2. 功能

**当前 POC 设计**：

- 在预算内从已选原帖采一级评论与可得回复，保留原帖、根线程、直接父评论/回复对象；缺父链、不可见与失败分开，不把未知父关系当一级评论。
- 平台宣称评论总数、实际可读数、本轮新增数分别显示；记录热评/最新/默认排序、页数、上限、截断及真实抓取批次，不能把重读缓存当增量。
- 评论无需复述关键词，结合原帖和可得父评论判断主题相关性；四档相关性与分析执行状态分开，情感可不执行，短回复信息不足则保留不足标签。
- 旧帖新评论只针对已明确跟踪的帖子集合；不重置原帖发布时间或首次发现。重复消费、取消、父评论晚到与内容变化保留可核对关系。
- 评论及分析均按所属用户读取，登录可见材料不自动公开，凭据不进入正文、模型或证据。用户能够展开上下文并打开原始出处。

数据库与契约需解耦现有“相关=true 必须有情感”的约束，见[数据库设计](../product/reference/07-关键词监控数据库设计.md)；这仍是待实现差量。验收不把评论样本当全平台观点分布。以下为**后续情感与持续监控**需求：

- 每小时增量采集主题命中帖子的评论（一级评论，加上能取到的二级回复），可以追溯到原帖和直接父评论。
- 每小时对新内容做相关性判断、三分类情感（正面 / 中性 / 负面）和观点提取；每条观点都引用原文，数量和占比由程序按明确的分母计算。
- 告警：“评论量一小时内突增”和“负面占比超过阈值”两条规则，每 5 分钟评估一次，有冷却期，站内通知。
- 舆情看板：主题的声量趋势、情感分布、平台分布、代表评论，数字可以下钻到原帖和评论。

## 3. 做法

| 平台 | 方式 |
|---|---|
| Hacker News | 公开 API，已实现 |
| B 站、微博、抖音、小红书及国内其余工作清单 | [MediaCrawler](https://github.com/NanmiCoder/MediaCrawler) 是本机候选，逐能力/版本验证；当前 B 站有桥接，其余不能由同一项目名称推断接通 |
| X | 见 [03](03-每日社媒热点.md) 方案 B |
| Reddit | 只走官方 API + OAuth，需本人申请获批后再做 |

- 情感和观点由本机 Codex app-server 生成（`ai` 领域已有适配器），每小时随采集批量运行。
- 参考 [BettaFish](https://github.com/666ghj/BettaFish) 的证据阅读和分析流程；当前 LICENSE 存在混合附加文本，本项目只参考、不复制代码，也不引入其模型或收费搜索路径。
- MediaCrawler 使用自定义非商业学习研究许可，个人非商业不自动证明所有用途适用。微博可比较 MIT WeiboSpider；各候选的免费路径、许可和父链限制见[GitHub 调研](../research/2026-10-07-GitHub免费热点与评论采集调研.md)。
- 当前 B 站评论读取搜索所留 JSONL；后续要用实际批次证明重新采集，不能仅凭有评论接口就声称旧帖回复持续刷新。

## 4. 现状

| 项 | 状态 |
|---|---|
| HN 评论与父链 | 可用：两个账户有真实帖子和评论 |
| B 站评论 | 部分可用：代码在，修复后的真实采集未通过，开关关闭 |
| 微博、抖音、小红书评论 | 未开始 |
| 情感与观点 | 部分可用：字段与流程已实现，还没有用真实 Codex 跑出结果 |
| 告警规则 | 部分可用：规则、冷却、重放边界已实现，没有真实触发过 |
| 舆情看板 | 未开始 |

## 5. 验收标准

当前免费、父链、短回复、时间、去重与两轮增量按 [POC 卡](../research/2026-10-07-国内平台关键词监控POC验证.md)及[验收场景](../research/2026-10-07-关键词监控验证与交付设计.md)执行，数值唯一来源是总 PRD。以下为历史舆情阶段标准；风控停止底线持续适用。

1. HN、B 站、微博、抖音或小红书中至少 4 个平台，各有 ≥10 帖、≥50 条真实评论，并能追溯父链。
2. 冻结 200 条样本（中文 150、英文 50）人工标注后评测：情感准确率 ≥85%，负面召回率 ≥85%，观点引用能直接支持观点的比例 ≥95%。
3. 真实负面突增发生后，≤65 分钟内站内可见告警；冷却期内或重复处理时，不会重复通知。
4. 任一登录平台出现验证码、登录失效或限流后，在本人人工恢复之前，新增请求为 0。

## 6. 不做什么

- 不保证全量评论；单帖评论有上限，被截断的要明确标出。
- 不用多账号、代理池或打码服务，不发评论、不私信。
- 不识别图片和视频画面，也不转写音频。

## 验收记录

验收记录放在 `records/` 目录下，文件元数据中的 `capability` 字段指向本文。目前还没有。
