ARTICLE · 人工智能

突发!Gemini 3.8 登顶,谷歌迈出 RSI 一大步

作者:大模型智能 来源:大模型智能 2026-09-04 00:00 18 分钟 15 阅读 4336 字
模型发布大语言模型 (LLM)AI产品动态强化学习AI Agent
一语总结

Google 发布 Gemini 3.8 Flash,以极低价格实现接近顶级旗舰的基准表现,并推出 Cyber 安全专属版本屠榜;文章同时梳理三大模型厂商的差异化竞争路线。

AI 总结

文章报道 Google 发布 Gemini 3.8 Flash 及其网络安全版 Cyber,单任务成本仅 0.58 美元,在 Artificial Analysis 智力指数达 59 分,逼近 GPT-5.6 Sol 与 Opus 5;Cyber 版在 CyberGym 基准达 86.2%并两小时内发现关键漏洞。文章指出 Flash 系列快速迭代源于 Pro 版未达预期、Gemini 4 后训练未完成。同时分析三大厂商策略差异:Anthropic 追求知识可靠性,OpenAI 押注深度推理,Google 走低成本高速迭代的 Agent 路线。文中也提及 Meta 对 Artificial Analysis 基准的质疑及可能的「刷榜」争议。

核心要点
  1. Gemini 3.8 Flash 以极低价格实现接近顶级旗舰的基准表现,打破「大参数=强能力」的竞争逻辑。

    单任务成本 0.58 美元、输入 0.75 美元/百万 Tokens,在 DeepSWE 等软件工程基准上超越多数昂贵模型;通过额外推理步骤和工具调用的 Agent 循环策略,用低成本暴力迭代换取高智商表现。

  2. Cyber 安全版本在漏洞发现和修复任务上屠榜,谷歌因此限制开放范围。

    在 CyberGym 基准达 86.2%,内部 20 种语言代码库漏洞发现率超 70%,补丁生成量是前代商业模型的 2.6 倍;因攻防能力过强,仅通过 Fairwind 计划向受信任机构开放。

  3. Flash 系列快速迭代是因为 Pro 版本未达预期、下一代 Gemini 4 后训练尚未完成。

    内部 3.5 Pro 候选模型因与 Flash 身位不足被毙掉,Gemini 4 预训练数据漂亮但后训练未完成,导致 Flash 成为当前主力推出口径。

  4. 三大厂商已走上差异化进化路线:Anthropic 重可靠性,OpenAI 重推理,Google 重 Agent 循环。

    Claude 在知识覆盖测试降维打击,GPT-5.6 Sol 在物理数学推导断崖领先,Gemini 3.8 Flash 则以低成本高速迭代适配长程 Agent 工作流,三者代表不同技术哲学。

  5. 基准测试表现与实战能力之间存在争议,可能存在「刷榜」成分。

    Meta AI 负责人质疑 Artificial Analysis 排名,且 3.8 Flash 在 TBench 2.1 与 4 之间分数差距巨大,暗示对未见过的零样本真实挑战可能仍不如参数巨兽。

突发!Gemini 3.8 登顶,谷歌迈出 RSI 一大步

文章报道 Google 发布 Gemini 3.8 Flash 及其网络安全版 Cyber,单任务成本仅 0.58 美元,在 Artificial Analysis 智力指数达 59 分,逼近 GPT-5.6 Sol 与 Opus 5;Cyber 版在 CyberGym 基准达 86.2%并两小时内发现关键漏洞。文章指出 Flash 系列快速迭代源于 Pro 版未达预期、Gemini 4 后训练未完成。同时分析三大厂商策略差异:Anthropic 追求知识可靠性,OpenAI 押注深度推理,Google 走低成本高速迭代的 Agent 路线。文中也提及 Meta 对 Artificial Analysis 基准的质疑及可能的「刷榜」争议。

文章金句

"

对模型而言,这只是迈出了一小步;但对于 RSI 来说,这是一次巨大飞跃。

"

这些性能的提升源于核心的设计选择:3.8 Flash 工作得更努力。

"

在 Agent 的时代,我可以一秒钟思考 100 次,用极低成本的暴力迭代,硬生生砸出正确结果。