跳至正文

关键词监控数据库设计

本页替换此前为完整关键词分析平台预设的大量增量方案。当前数据库设计统一在页面数据库设计,监控功能由主题工作区、新建主题、主题详情和资料评论约束。

设计边界与结论

当前页面需要保存主题规则/来源/频率、可追溯帖子与评论、任务状态和已有分析。最近5条结果、页签、筛选、预览、计数都不要求新建业务表。保留正在使用的版本、观察、来源预算和任务恢复;不因页面没有直接显示就删除。

需求与实体映射

页面动作/显示当前数据来源当前决定
新建/修改关键词和来源monitor_topics、monitor_topic_versions、source_connections/versions复用规则版本,更新比较expected_version
频率/暂停/继续monitor_schedules、状态事件和原调度链服务端调度;不在浏览器定时采集
立即运行与原任务jobs、attempts、outbox、due/coverage windows原job_ids与skip回执,不再建批次状态机
最近5条/完整内容列表content身份/版本/观察、发现和主题匹配复用现有查询,明确当前命中管线范围;不复制主题正文
原帖/评论上下文content_threads和相同content存储关系与正文分开;缺父保留状态
相关性/情感面板content_annotations及固定规则/提示词/输入当前bool/null合同保留,不伪造四档或百分比
热度/告警/报告已有event_attention_snapshots、alert、reports仅使用可解释数据,不预建完整舆情分析仓库

四档相关性与情感解耦

此前提出direct/indirect/irrelevant/insufficient、候选关联和置信时间等结构,是后续分析质量的可能方向,已撤出当前页面实施前置。重新提出时先准备有分歧和未知状态的真实样本,证明现有bool/null合同不能满足具体控件,再设计版本兼容;不能把旧数据自动回填为direct或neutral。

写入、游标与幂等

主题配置、正文身份去重、观察记录和任务受理分别复用现有事务。更新比较版本,来源准入和owner由服务端校验。列表分页固定查询范围;即时运行响应未知先查询已受理Job或按现有幂等键恢复。当前没有独立跨刷新批次历史合同,不能写成已经支持。

查询与索引建议

主题结果只取5条,完整内容/根评论/回复各按20条分页。先在独立测试库测现有查询及授权过滤,再处理实际慢查询;不先引入新搜索服务、候选仓库或向量数据库。详细类型、键和读取关系见核心存储。

留存、恢复与可观测

来源发布时间、观察时间和接收时间保持不同含义;无结果、部分覆盖、登录失败、风控和来源删除不同。留存遵守实际来源策略,删除要处理报告/事件/证据引用。物理迁移先备份并在独立库实际恢复;唯一schema不直接在业务库试跑。

数据验收场景

新建主题→保存后重读→运行受理→来源部分跳过→帖子/评论→第二轮去重和新增→暂停后不再新外发;追加跨账号读取、旧版本修改、超时恢复和缺父评论。真实采集和自然到期必须单独记录,源码/固定样本不能替代。详见当前验收。

原始 Markdown