Gemini 4 Argon发布:100万Token输出、企业任务领先、成本仅为Astra的60%

谷歌发布新一代企业级模型Gemini 4 Argon,在软件工程、法律金融等任务中表现优异。

谷歌发布Gemini 4 Argon,企业级能力成焦点

谷歌发布Gemini 4 Argon,企业级能力成焦点
谷歌发布Gemini 4 Argon,企业级能力成焦点|新闻截图

谷歌于2026年10月1日凌晨正式发布新一代旗舰模型Gemini 4 Argon,面向软件工程、法律与金融等企业知识工作,以及网络安全防御等复杂长周期任务。核心硬信息如下:

  • 发布时间:2026年10月1日
  • 新版本:Gemini 4 Argon(含High-tier版本)
  • 初始价格:输入Token每百万2美元,输出Token每百万10美元;缓存输入Token每百万约0.1美元
  • 可用时间:通过“Fairwind计划”向筛查后的网络安全防御团队开放;付费API客户与Google AI Ultra订阅者为首批用户
  • 权重开放: internals for Google员工,安全敏感场景下提供无护栏版本给认证团队

企业任务与技术参数全面领先

企业任务与技术参数全面领先
企业任务与技术参数全面领先|新闻截图

Gemini 4 Argon在多项专业基准测试中超越竞争模型。其最大亮点是将输出上限提升至100万Token,成为目前业内输出容量最高的模型之一,可支持单次任务生成数十万甚至上百万Token,适用于大型代码库处理与多步骤企业流程。

关键测试表现如下:

  • DeepSWE v1.1(长程软件工程能力):77.9%,刷新历史最好纪录
  • Vals Index(金融、编程、法律、税务综合评估):排名第一
  • AutomationBench(企业端到端自动化执行):51.3%,明显领先GPT-6 Astra与Claude系列
  • LVBench(长视频理解):91.7%,达当前最优水平
  • CWE-bench v1(漏洞修复):68%,与GPT-6 Astra并列第一

值得注意的是,内部反馈与基准测试呈现明显反差。据彭博社援引知情人士称,部分谷歌员工反映Argon在实际编程任务中“仍较为吃力”,与测试成绩形成对比,暗示其在真实场景下的稳定性有待验证。

价格与性能对比

价格与性能对比
价格与性能对比|新闻截图

根据Artificial Analysis数据,Gemini 4 Argon在成本-性能权衡上优势显著。按折扣定价,其每任务成本为1.99美元,较GPT-6 Astra(max)降低40%;Text Arena中,High-tier版本以1525分与每百万Token 8美元进入成本-性能前沿。

模型每任务成本(美元)文本性能得分输出上限
Gemini 4 Argon1.9953(Artificial Analysis)100万Token
GPT-6 Astra约3.3(按40%成本差计算)53未公开
Claude Opus 5.5-54+未公开
Claude Fable 5.1-53未公开

开发者使用建议

开发者使用建议
开发者使用建议|新闻截图

  • 适合立即尝试:企业客户、网络安全团队、付费API使用者。Argon在自动化流程、漏洞检测与内部代码迁移实测中展现价值,尤其适配需要100万Token长上下文的复杂任务。
  • 建议再等等:追求3D场景生成细腻度的创意工作者;对提示词鲁棒性要求高的开发者。部分用户反馈Argon默认风格不佳且对提示词异常敏感,生成质量显著依赖提示优化。

写在最后

Gemini 4 Argon标志着大模型从通用能力向专业企业任务的深度迁移。尽管基准测试亮眼且内部应用成果显著,但实际落地表现仍需开放后用户验证——技术指标领先不等于业务场景无缝承接,这或是本轮发布最值得行业的清醒认知。