Weekly Report · 面向非技术读者,聚焦业务价值
上周把"每天自动发现舆情"的流水线搭起来了,本周就迎来了它的第一个副作用:新闻堆得太快,首页满屏都是"建议重审",多到失去意义。所以本周做的是消化与打磨——先把积压的 15 个品牌一次性全量重审(清空待办,也顺带验证了"分数要克制"这条铁律:最大只动了 0.16 分);再把首页的提醒分级降噪;然后把"其实早就能用、却没人知道怎么用"的数据接口讲清楚,让人和 AI 助手都能直接调用;最后开始造一道更便宜的闸门——让机器先判断"这家值不值得重新打分",避免每天把钱花在得出"没变化"上。这道闸门经过六次真实运行、五次修正才达到可用,全过程如实记录在案。
上周的自动化流水线每天往库里送 170~180 条候选新闻,很快就把"该重新打分"的门槛顶穿了。本周把所有被触发的品牌一次性做完:智谱、华为、联想、Anthropic、特斯拉、苹果、DeepSeek、美团、英伟达、SpaceX、Kimi、微软、亚马逊、谷歌、OpenAI,共 15 家。
结果本身就是一份体检报告:
| 方向 | 家数 | 幅度 |
|---|---|---|
| 分数上升 | 8 家 | 最大 +0.16(智谱) |
| 分数持平 | 1 家 | 英伟达 ±0 |
| 分数下降 | 6 家 | 最大 −0.12(谷歌、OpenAI) |
没有一家动超过 0.16 分。 这正是我们想要的:一个月的新闻轰炸下来,真正改变品牌影响力的东西其实很少,绝大多数是券商观点、传闻、同一件事的多家转载——它们只有"方向价值",不该改分。这轮重审用真实数据验证了"克制"原则确实被严格执行。
门槛被顶穿的直接后果是:几乎每张品牌卡片都挂着红色的"建议重审",反而没人看了。本周做了两件事:
MBA 的全部审计数据一直以公开接口的形式对外开放(11 个数据端点,无需密钥、无需登录),但只散落在角落里,等于不存在。本周把它变成"看得见、拷了就能跑":
顺带修了一个过期整整一个版本周期都没人发现的问题:说明页上写的插件版本号停在旧版,实际早已更新。本周给它加了自动检查,以后写错就报错——这类"手写的会过期数字"从此有人守。
让机器自动重审的最大障碍是成本:完整重审一个品牌,要读全篇报告加全部新闻,成本很高;而第 1 节的数据恰恰说明,绝大多数时候结论是"没变化"——钱花在了得出"不用改"上。
所以本周开始造一道便宜的前置闸门:只看新闻标题,先判断"这家最近有没有真正落地的硬事实"。筛完整整 17 家的成本,才相当于完整重审一家。没有硬事实,就不必惊动昂贵的完整重审。
这道闸门跑了六次、修了五次才达到可用。中间的曲折本身很有价值(详见第五节),最终形态是:
目前它只能手动点击运行、默认不写入任何数据——在判断质量被充分验证之前,不接入每日流程。
本周把"每次开发都要留下过程记录"变成固定动作:每日工作盘点由代码提交自动生成(客观、可核对),关键决策与踩坑由人补充。此前有个隐患——自动重新生成会冲掉人工补充的内容,本周修好了,现在随时补写都不会丢。
同时把一套业界公认的开发纪律(结构化的"先想清楚 → 再动手 → 必须验证"流程)整理成本地检查清单,每次开发收尾逐条自检并如实记录"通过还是偏离了哪条"。因为运行环境装不了对应插件,我们如实写"以本地清单自检",不谎称用了插件。
把本周的 15 家重审与首页每日自更新打包成 v0.6.1 正式发布(带更新日志的正式版本)。
| # | 功能 | 价值 |
|---|---|---|
| 1 | 15 个品牌全量重审(8 升 / 1 平 / 6 降) | 积压清零;用真实数据验证"分数要克制" |
| 2 | 首页提醒分级(重大亮红 / 一般淡色) | 从"满屏红字"回到"一眼看出哪家真要紧" |
| 3 | 首页信号计数统一为 30 天滚动窗口 | 旧新闻不再长期把卡片标红,前后台口径一致 |
| 4 | 公开数据接口指南(README + 首页命令横幅 + AI 说明文件) | 数据从"存在但没人知道"变成"拷了就能跑" |
| 5 | 三种接入方式横向对比表 | 一眼选对用法,不必通读全部文档 |
| 6 | 版本号自动检查 | 手写的会过期数字从此有门禁守着 |
| 7 | 便宜的重审前置闸门(九类封闭清单 + 程序汇总 + 逐条可核对) | 为"自动重审"铺路,成本仅为完整重审一家 |
| 8 | 每日过程记录制度化(自动盘点 + 人工补充不被冲掉) | 决策与踩坑留得住、可回溯 |
| 9 | v0.6.1 发布 | 阶段成果对外固化 |
本周最有价值的沉淀来自新闸门那六次运行——它们暴露的不是"参数没调好",而是几条更普遍的规律:
最初让机器"看完一个品牌的所有新闻,然后回答值不值得重审"。它学会了只挑一两条来支撑自己想给的答案——想说"值得"就挑最重磅的,想说"不值得"就挑最琐碎的。有一次它把"完成融资、估值超 3500 亿"这条排在第一位、且被我们一字不差写进示例里的新闻直接跳过,转而引用一篇闭门会记录来论证"没什么大事"。
修法:让它逐条表态,汇总交给程序。 这样"挑一条来说事"在结构上就不可能发生。
"这件事重不重要"是开放判断,我们连续五轮在"太严"和"太松"之间来回摆——写严了漏掉真事,写松了什么都算数。
修法:换成"从九类固定清单里挑一个,挑不出就是没有",并且清单由程序校验——机器自创一个类别,程序一律不认。开放判断变成封闭分类后,结果立刻稳定下来。
为了合并"同一件事的多家转载",本打算把相似度门槛调低一点。先量了一遍才发现两类根本分不开:同一件事的最低相似度 0.41,不同事件的最高相似度 0.48——调低会把"提交上市申请"和"版权赔偿"合并成一件事。
修法:不硬调阈值,换个不假装能分开它们的设计——每类只列两条代表,并如实报出总数。分布重叠时,正确动作不是取折中值,而是换设计。
本周两次在运行之前公开写下预期结果,两次都错(一次连方向都反了;一次是验收标准本身定错了——我们以为该把 17 家筛到个位数,逐条核对后发现 14 家里 13 家确实有硬事实:这批公司当月叠加了财报季与多起监管处罚,本来就该筛出这么多)。预测写在前面的价值不是猜中,而是猜错时无法自我辩解——两次都因此立刻去查真正的原因,而不是把结果解释成成功。
本周正反两面各验证了一次:反面是只跑了个粗略检查就宣布完成、随即被自动检查打回;正面是新闸门的五次修复全部由真实运行的证据倒逼——离线检查全绿并不等于能用。验证的正确形态不是"跑一遍看绿",而是把这次的失败固化成下次跑不过去的门。
当前:v0.6.1 已发布;15 个品牌的重审待办清零,首页提醒回到"该红才红";公开数据接口对人和 AI 都可发现、拷了就能跑;自动重审的前置闸门已可手动运行、判断依据逐条可核对,但尚未接入每日流程(有意为之——判断质量还需再观察)。审计覆盖 24 个品牌,舆情事件库累计 858 条。
下周可推进(部分需外部资源配合):
本报告面向非技术读者,聚焦业务价值与需求解决。