球友会

热点资讯

刚刚,谷歌Gemini 4 Argon杀回前三!追平GPT-6 Astra,Token价只要1/5

新智元报道 谷歌沉寂7个月,终于掏出了大的。 北京时间10月1日凌晨,Google DeepMind发布Gemini 4 Argon。这是其 7 个月来首款非 Flash 级专有模型。 Artificial Analysis的智能指数上,它拿到53分,追平GPT-6 Astra和Fable 5.1,比GPT-6.1 Sol高1分,幻觉率降至 15%。 模型在 AutomationBench-AA 和 Terminal Bench 上 Agent 能力大幅提升,同时在 CWE-bench 网络安全基准并列第一,可自主发现、验证漏洞并生成 PoC。 目前已向选定用户 rollout,支持 1M 上下文和多模态输入,直接冲击前沿模型价格战格局。 同一套评测里,按首发折扣计算,完成一个任务平均花1.99美元,为 GPT-6 Astra 的 60%。 分数追平,账单变薄。光看这两项,谷歌这次足够让人重新考虑该把任务交给谁。 但我把分数、报价和用量放在一起看,最有意思的地方出现了。这款模型算得便宜,却算得很费。打折结束,同样的任务甚至会比Astra更贵。 前三回来了,账得重新算 所谓沉寂7个月,有一个明确范围。Argon是谷歌超过7个月来第一款高于Flash级别的闭源模型,期间谷歌仍有Flash产品。 这次53分,比上一款非Flash模型Gemini 3.1 Pro Preview高23分,比Gemini 3.8 Flash高12分。AA据此判断,谷歌重回智能水平最高的3家实验室之列。 智能指数可以理解为一组能力测试的综合成绩。Argon用high推理档,Astra和Sol用max档,同分说明它们在这套评测里处于相近水平,具体工作还得分开看。 对长期关注OpenAI和Anthropic的用户,这个变化很直接。选前沿模型时,谷歌又成了值得认真比较的选项。不过Argon目前只向部分用户推送,尚未公开可用。 谷歌准备怎样吸引这些用户?报价很有诚意。 Token可以粗略理解为模型读写文字时计数的小片段。当前每百万Token,Argon输入收2美元,输出收10美元。两项单价都是Opus 5.5的一半、Astra的1/5。 反复使用同一段材料,还涉及缓存。符合缓存条件的输入可以享受95%的折扣,比Gemini 3.8 Flash的90%更低,首发期间每百万缓存输入Token只收0.10美元。 看起来相当划算。可用模型的人付的是整张账单,单价只是其中一项。 Argon平均每个任务输出6.2万Token,Astra只用2.7万。如果把推理过程比作打草稿,它的草稿纸要多写1倍多。每页便宜,架不住写得长。 算到任务成本,Argon的1.99美元确实低于Astra的3.26美元、Opus 5.5的5.98美元和Fable 5.1的7.63美元。但Sol只要0.72美元,Argon约是它的2.7倍。 更影响长期选择的是,2美元和10美元属于首发5折促销,谷歌还没公布结束日期。 恢复输入4美元、输出20美元的标准价后,按同一评测口径,单任务成本会变成3.98美元,约为Astra的1.2倍。 这些美元数字还有一个共同前提,它们是智能指数测试里的平均任务成本。你让模型改代码、查材料,输入有多长、输出多少、能用上多少缓存,都会改变账单。1.99美元不能当成所有工作的统一报价。 这就很有意思了。单价只有对手的1/5,任务账单却要付六成;促销结束,还会反超。打算长期接入的人,得拿自己的任务试算,用量和折扣条件都算进去。 少说错话,也有代价 钱算清了,还得回答一个问题。53分的Argon,究竟好用在哪里? 我最在意的是它处理「不知道」的方式。 在AA-Omniscience测试里,Argon的幻觉率为15%,是智能指数45分以上模型中最低的。Astra为51%,Sol为54%。AA的解释是,Argon更愿意承认不知道,减少猜错后仍然给答案的情况。 这对用户很有吸引力。碰到不熟悉的问题,回答越流畅,核对起来越容易掉以轻心。模型肯停下来承认能力有限,至少能让人知道哪里还需要查证。 不过,少编答案,和多答对题,是两件事。 Argon在这项测试里的准确率为50%,比Astra的63%低13个百分点,甚至比Gemini 3.1 Pro Preview低5个百分点。综合分为42,接近Astra的43,与Sol相同。 你可以欣赏它的克制,同时承认它答对的问题没有Astra多。15%的幻觉率也仅属于这项测试,不能直接当成所有日常回答的错误率。 真正动手干活的Agent能力,则呈现出另一种参差。 AutomationBench-AA上,Argon以77.5%拿到第一。但Terminal Bench 4里,它得57%,虽然比Gemini 3.1 Pro Preview提高53个百分点,仍落后于S

about image