ARTICLE · 人工智能
突发!Gemini 3.8 登顶,谷歌迈出 RSI 一大步
一语总结Google 发布 Gemini 3.8 Flash,以极低价格实现接近顶级旗舰的基准表现,并推出 Cyber 安全专属版本屠榜;文章同时梳理三大模型厂商的差异化竞争路线。
文章报道 Google 发布 Gemini 3.8 Flash 及其网络安全版 Cyber,单任务成本仅 0.58 美元,在 Artificial Analysis 智力指数达 59 分,逼近 GPT-5.6 Sol 与 Opus 5;Cyber 版在 CyberGym 基准达 86.2%并两小时内发现关键漏洞。文章指出 Flash 系列快速迭代源于 Pro 版未达预期、Gemini 4 后训练未完成。同时分析三大厂商策略差异:Anthropic 追求知识可靠性,OpenAI 押注深度推理,Google 走低成本高速迭代的 Agent 路线。文中也提及 Meta 对 Artificial Analysis 基准的质疑及可能的「刷榜」争议。
- Gemini 3.8 Flash 以极低价格实现接近顶级旗舰的基准表现,打破「大参数=强能力」的竞争逻辑。
单任务成本 0.58 美元、输入 0.75 美元/百万 Tokens,在 DeepSWE 等软件工程基准上超越多数昂贵模型;通过额外推理步骤和工具调用的 Agent 循环策略,用低成本暴力迭代换取高智商表现。
- Cyber 安全版本在漏洞发现和修复任务上屠榜,谷歌因此限制开放范围。
在 CyberGym 基准达 86.2%,内部 20 种语言代码库漏洞发现率超 70%,补丁生成量是前代商业模型的 2.6 倍;因攻防能力过强,仅通过 Fairwind 计划向受信任机构开放。
- Flash 系列快速迭代是因为 Pro 版本未达预期、下一代 Gemini 4 后训练尚未完成。
内部 3.5 Pro 候选模型因与 Flash 身位不足被毙掉,Gemini 4 预训练数据漂亮但后训练未完成,导致 Flash 成为当前主力推出口径。
- 三大厂商已走上差异化进化路线:Anthropic 重可靠性,OpenAI 重推理,Google 重 Agent 循环。
Claude 在知识覆盖测试降维打击,GPT-5.6 Sol 在物理数学推导断崖领先,Gemini 3.8 Flash 则以低成本高速迭代适配长程 Agent 工作流,三者代表不同技术哲学。
- 基准测试表现与实战能力之间存在争议,可能存在「刷榜」成分。
Meta AI 负责人质疑 Artificial Analysis 排名,且 3.8 Flash 在 TBench 2.1 与 4 之间分数差距巨大,暗示对未见过的零样本真实挑战可能仍不如参数巨兽。
突发!Gemini 3.8 登顶,谷歌迈出 RSI 一大步
文章报道 Google 发布 Gemini 3.8 Flash 及其网络安全版 Cyber,单任务成本仅 0.58 美元,在 Artificial Analysis 智力指数达 59 分,逼近 GPT-5.6 Sol 与 Opus 5;Cyber 版在 CyberGym 基准达 86.2%并两小时内发现关键漏洞。文章指出 Flash 系列快速迭代源于 Pro 版未达预期、Gemini 4 后训练未完成。同时分析三大厂商策略差异:Anthropic 追求知识可靠性,OpenAI 押注深度推理,Google 走低成本高速迭代的 Agent 路线。文中也提及 Meta 对 Artificial Analysis 基准的质疑及可能的「刷榜」争议。
文章金句
"对模型而言,这只是迈出了一小步;但对于 RSI 来说,这是一次巨大飞跃。
"这些性能的提升源于核心的设计选择:3.8 Flash 工作得更努力。
"在 Agent 的时代,我可以一秒钟思考 100 次,用极低成本的暴力迭代,硬生生砸出正确结果。