ARTICLE · 人工智能
Manus 团队测模型一点微小的经验
一语总结Manus 团队分享了 Research Bench 评测实践的两大指标——「信息量」与「隐喻率」,通过 LLM 抽取事实点数和统计比喻频率来量化研究报告质量,并展示了 GPT、Claude、Gemini 等主流模型的对比结果。
本文介绍了 Manus 团队在 Research Bench(研究报告质量评测)中构建的两个量化指标:「信息量」和「隐喻率」。信息量指标通过 LLM 逐篇抽取事实点和数据点的数量,横向比较不同模型生成的报告信息密度;隐喻率指标则统计每百句话中的比喻表达次数,反映模型的写作风格与可读性。文章展示了 GPT-5.6、Claude Fable-5、Opus-5、Gemini-3.7-flash、Grok-4.6 等 9 个主流模型在两项指标上的实测数据,并分享了通过 Prompt 规范改进 GPT 信息量的实践案例。作者强调指标设计需同时满足有效性和可靠性,并指出这仅是海量可挖掘 Signal 中的一小部分。
- 研究报告质量的本质是两个维度:信息内容与组织方式
一份报告的好坏取决于:包含哪些信息(决定用户能否读到高质量内容)和这些信息如何组织(决定用户能否低成本理解)。从这两个维度出发可构造大量可量化指标。
- 「信息量」指标通过 LLM 抽取事实点数量衡量信息密度
同主题下,模型 A 写 7 个事实点(iPod 发布时间、硬盘规格、容量、接口等),模型 B 仅 2 个事实点,其余均为评价修饰语。GPT 模型因倾向于写完整总结笔记导致信息损失更高,通过 Prompt 规范笔记写法后有效改善。
- 「隐喻率」指标量化模型文风,反映可读性与信息损失
隐喻作为把 x 词映射为 y 词的「语言函数」,本质上带来信息损失(y 的信息量 ≤ x)。Fable-5 隐喻率最高(偏好身体/有机体表达),GPT-5.6 最克制,Gemini 偏宏大词汇,Grok 偏商业竞争隐喻。低隐喻率不等于绝对更易读,但是一个可操作的 Signal。
- 指标设计原则:有效且可靠,需长期线上验证
有效的指标能让 Signal 简洁直接反映模型特点,分数高低帮助定位产品问题;可靠的指标可量化且自动化评测稳定。隐喻率的标注需排除日常无感隐喻和术语比喻,并要求每个标注输出字面替换作为反向校验。
Manus 团队测模型一点微小的经验
本文介绍了 Manus 团队在 Research Bench(研究报告质量评测)中构建的两个量化指标:「信息量」和「隐喻率」。信息量指标通过 LLM 逐篇抽取事实点和数据点的数量,横向比较不同模型生成的报告信息密度;隐喻率指标则统计每百句话中的比喻表达次数,反映模型的写作风格与可读性。文章展示了 GPT-5.6、Claude Fable-5、Opus-5、Gemini-3.7-flash、Grok-4.6 等 9 个主流模型在两项指标上的实测数据,并分享了通过 Prompt 规范改进 GPT 信息量的实践案例。作者强调指标设计需同时满足有效性和可靠性,并指出这仅是海量可挖掘 Signal 中的一小部分。
文章金句
"隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。
"从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的「语言函数」(y=f(x)),势必会带来信息的损失,因为 y 的信息量一定小于等于 x。
"GPT 的 Search 工具调用平均次数甚至高于 Claude 模型,如果信息量低不是因为信息接触得少,那也许就是发生了某种信息的丢失。
"即使是信息量这一个指标,仍有不少的未竟的话题,比如怎么防止一个模型提升信息量的同时也提升了废话的数量等等。
"如何把主观感受通过一个简洁优雅的切口量化出来,是最需花心思的部分,指标的有效性也需要长期的线上数据跟踪来验证。