|
10 月 1 日消息,谷歌昨日(9 月 30 日)发布 Gemini 4 Argon,称其为公司迄今最先进的 AI 模型,但目前并未面向公众全面开放。
定位方面,Gemini 4 Argon 是谷歌当前“最先进”模型,重点是长流程软件工程、企业知识工作和网络安全防御。官方称其在真实世界软件工程测试创纪录,网络安全基准并列第一,并在金融、法律等专业任务基准领先。 模型特性方面,Gemini 4 Argon 单次输出上限达到约 100 万 tokens,高于此前的 64,000 tokens,适合处理大型代码库、长文档和多阶段任务。
谷歌 DeepMind Gemini 产品负责人 Tulsee Doshi 表示:“Argon 是一个功能全面的模型,在多个领域都具备前沿能力。” 在新模型在某些编码和知识工作基准测试中处于最先进水平,在多个方面都优于竞争对手 OpenAI 的前沿模型 GPT-6 Astra。 性能方面,谷歌宣称其 DeepSWE v1.1 得分为 77.9%。Claude Opus 5.5 的得分为 74.2%,GPT-6 Astra 的得分为 74.1%。 安全防御性能方面,谷歌对 Gemini 4 Argon 进行了训练,使其“在网络安全防御方面能力超群”,比 3.8 Flash Cyber 有了显著提升。在评估模型修复安全漏洞能力的 CWE-bench v1 测试中,Argon 以 68% 的最高分并列第一。
分发方面,谷歌表示会分阶段发布,第一阶段通过名为 Fairwind Program 的计划,提供给受信任的网络安全防御者,并参与美国政府的自愿预发布模型访问流程。
费用方面,谷歌计划先向付费 API 客户和 Google AI Ultra 用户开放,之后再扩大到企业和普通消费者:
AI 解读 长上下文才是这代重点
先看参数。输出上限从 6.4 万 tokens 跳到约 100 万,这个提升比榜单上那几个百分点更值得注意。它意味着模型可以一次性吐出大型代码库、长文档或多阶段任务的完整结果,而不用反复拼接。 GraphWalks 在 256K 到 1M 区间拿到 84.2%,也说明超长上下文不是纸面数字,是有对应测试支撑的。 再看代价。价格表写得很清楚:输入每百万 2 美元、输出每百万 10 美元只是初始价,后续会翻倍到 4 美元和 20 美元。缓存输入有约 95% 折扣,这对反复调用同一份长文档或代码库的场景是实打实的省钱项。但输出价格本身不低,长输出又正是它的卖点,实际用起来成本要按翻倍后的价格算。 对普通用户来说,短期内买不到。第一阶段只给受信任的网络安全防御者,之后才轮到付费 API 客户和 Google AI Ultra 用户,企业和消费者排在最后。所以现在能判断的是能力方向,不是能不能用上。 关注长输出和缓存折扣的实际成本,别只看榜单第一名。 以上内容由 AI 依据原文补充生成,不代表本站观点,仅供参考。 |
© 2013-2016 Discuz Team. Powered by Discuz! X3.5