ARTICLE · 人工智能

dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步

作者:小红书技术REDtech 来源:小红书技术REDtech 2026-08-14 19:25 25 分钟 39 阅读 6047 字
多模态 AI长程 Agent强化学习TEMPO 方法开源模型
一语总结

REDtech 开源 280B 参数的多模态模型 dots3-note Preview,并提出 TEMPO 方法提升长程强化学习,同时发布 VibeSearchBench 与 VibeLifeBench 两套真实生活评测基准。

AI 总结

文章宣布开源 dots3-note Preview,作为 dots3 系列中最轻量的模型,拥有 280B 参数、16B 激活参数,支持 512K 上下文并具备文本、视觉、语音的多模态理解能力。作者阐述了模型在复杂推理、长程 Agent 任务上的优化,并通过强化学习的 TEMPO 方法将长程任务拆分为 macro‑step,实现自我评价与策略更新。文章展示了在 ARC‑AGI‑3 等环境中的实验结果,说明模型在自我评估和记忆更新方面的优势,并提供了两个面向真实生活的评测环境 VibeSearchBench 与 VibeLifeBench,以促进社区复现和衡量长程任务能力。最后指出模型仍存在幻觉抑制、稳定性等局限,呼吁社区反馈共同推进 AI 为真实生活服务的目标。

核心要点
  1. dots3-note Preview 实现了 280B 参数的多模态基座,支持文本、视觉和语音的统一感知。

    模型在 512K 上下文窗口内能够同时处理三模态信息,并在多项任务上达到或超过更大规模模型的效果,展示了高效的跨模态能力。

  2. TEMPO 方法通过 macro‑step 将长程任务拆分,实现了测试时的价值估计与策略优化。

    在每个 macro‑step 结束后,Agent 从 actor 切换为 critic,利用推理分析估计剩余回报,从而在数十小时的任务上实现有效的强化学习训练。

  3. 发布 VibeSearchBench 与 VibeLifeBench 两套评测基准,推动真实生活长程任务的研究。

    VibeSearchBench 评估多轮搜索与工具调用,VibeLifeBench 评估跨阶段任务执行与状态一致性,为社区提供可复现的评测环境。

  4. 模型具备递归自我评价能力,能够在复杂环境中识别关键状态并更新记忆。

    实验显示,Agent 在测试阶段能够对相似状态进行价值区分,并在 IMO 2026 中取得满分成绩,验证了自评估在长程任务中的重要性。

dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步

文章宣布开源 dots3-note Preview,作为 dots3 系列中最轻量的模型,拥有 280B 参数、16B 激活参数,支持 512K 上下文并具备文本、视觉、语音的多模态理解能力。作者阐述了模型在复杂推理、长程 Agent 任务上的优化,并通过强化学习的 TEMPO 方法将长程任务拆分为 macro‑step,实现自我评价与策略更新。文章展示了在 ARC‑AGI‑3 等环境中的实验结果,说明模型在自我评估和记忆更新方面的优势,并提供了两个面向真实生活的评测环境 VibeSearchBench 与 VibeLifeBench,以促进社区复现和衡量长程任务能力。最后指出模型仍存在幻觉抑制、稳定性等局限,呼吁社区反馈共同推进 AI 为真实生活服务的目标。

文章金句

"

模型进行自我评估的能力非常重要。

"

TEMPO 将长程任务拆分为多个 macro‑step,每个 macro‑step 包含多轮模型与环境的交互。

"

dots3-note Preview 是我们朝这个目标迈出的一小步,也是一个新的起点。