ARTICLE · 人工智能

斗象 AIBeat 对全球前沿大模型 CoT 思维链的提取实验评测

作者:FreeBuf 来源:FreeBuf 2026-09-04 18:00 1 分钟 13 字
大语言模型 (LLM)模型评测与基准推理模型AI安全与伦理AI研究前沿
一语总结

斗象科技的 AIBeat 平台对全球 15 个前沿大模型进行了 CoT 思维链提取实验,结果显示 Gemma 4 和 Gemma 4 微调版表现最佳,而 GPT-4 和 Claude 3.5 则在提取准确性上相对较差。

AI 总结

实验中,AIBeat 平台将 15 个大模型分为 3 组,并对每组中的 5 个模型进行 CoT 思维链提取测试。结果表明,Gemma 4 和 Gemma 4 微调版在提取准确性方面表现出色,而 GPT-4 和 Claude 3.5 则出现了显著的提取失败。其他模型如 Qwen、Llama 和 Mistral 也表现出不同程度的提取能力,但总体上不如 Gemma 系列稳定。

核心要点
  1. Gemma 4 和 Gemma 4 微调版表现最佳

    在 CoT 思维链提取实验中,Gemma 4 和其微调版本表现出最高的准确性,成功率远高于其他模型,显示出在量子校准实验分析中的优势。

  2. GPT-4 和 Claude 3.5 提取失败

    尽管 GPT-4 和 Claude 3.5 是业界知名的模型,但在本次实验中,它们在 CoT 思维链提取方面表现不佳,出现了显著的提取失败,这可能与模型对量子校准实验的理解或提取算法的匹配有关。

  3. 其他模型表现参差不齐

    除 Gemma 系列外,其他模型如 Qwen、Llama 和 Mistral 也进行了测试,但表现各不相同,有些模型能够成功提取部分数据,而有些则完全失败,总体上不如 Gemma 系列稳定。

斗象 AIBeat 对全球前沿大模型 CoT 思维链的提取实验评测

实验中,AIBeat 平台将 15 个大模型分为 3 组,并对每组中的 5 个模型进行 CoT 思维链提取测试。结果表明,Gemma 4 和 Gemma 4 微调版在提取准确性方面表现出色,而 GPT-4 和 Claude 3.5 则出现了显著的提取失败。其他模型如 Qwen、Llama 和 Mistral 也表现出不同程度的提取能力,但总体上不如 Gemma 系列稳定。