Gemini 4 Argon:名字玄机与开放节奏
谷歌对Argon这个名字没有给出官方解释,但稍懂化学的朋友应该秒懂——氩(Argon)是第18号元素,在元素周期表里不算显眼,但性格稳定。这个代号其实早在内部测试阶段就一直沿用,这次发布也没换。发布方式同样没搞全量开放,而是先通过Fairwind计划向部分网络安全合作伙伴开放尝鲜。后续会逐步向付费API用户和Google AI Ultra订阅者开放,具体时间表还没公布。想第一时间体验的开发者,估计还要再耐点性子。
基准测试:13项领先,但编程翻车
谷歌官方一共列了18项基准测试,Gemini 4拿下了13项第一。其中知识工作类测试和长上下文测试GraphWalks的领先幅度尤其夸张。可编程这块就有点尴尬了。DeepSWE v1.1上得分77.9%,比对比模型高出4个百分点,听着还不错;可到了FrontierSWE v2和Terminal-Bench 4.0就直接垫底。第三方Arena.ai的评分也印证了这一点:Text Arena排第一,Code Arena: WebDev和Agent Arena都只有第八。可以说,这模型的文本理解与逻辑推理确实强,但写代码的稳定性还有待时间检验。
输出上限提升到100万token
上一代模型的输出上限是6.4万token,这次直接拉到了100万。什么概念?大约等于一次生成70万到100万个汉字。官方说法是,这让模型在单次推理内可以进行更深入的思考,不用频繁分段处理。对长文档分析、代码库理解这类场景,这个提升确实很实在。
定价:便宜到不像谷歌
官方API定价是每百万token输入2美元、输出10美元,缓存命中仅0.1美元。按首发优惠价来算,大约是GPT-6 Astra和Fable 5.1的五分之一,和GPT-6.1 Sol、Sonnet 5.5基本持平。这个价位放在旗舰模型里确实很能打。对创业团队而言,部署成本一下子降了不少。
幻觉率最低,但内部有分歧
Artificial Analysis的测试显示,Gemini 4的幻觉率约为15%,在目前所有前沿模型里是最低的。这个指标很关键,毕竟AI一本正经胡说八道,才是落地时最大的坑。不过有知情人士透露,Google内部员工对它的实际性能有所保留,尤其是部分编码任务。谷歌官方对此否认,也有内部员工表示认可。反正新模型刚出,口碑还得靠真实使用来沉淀。
对企业上云意味着什么
对企业上云这件事来说,模型实力只是一半,部署和成本是另一半。如果你正琢磨着怎么把AI能力接进现有业务,不妨看看阿里云代理商的方案。比如用云服务器ECS来跑模型推理,会省心不少。Gemini 4这种输出上限超高的模型,对算力和存储的要求自然水涨船高,这时一个靠谱的基础设施服务商就派上用场了。想规划上云路径的话,可以咨询易枫顺 - 阿里云官方旗舰级代理商,他们会帮你搭配合适的资源。别等到模型全面开放了才临时抱佛脚。
FAQ
Q: Gemini 4 Argon到底什么时候全面开放?
A: 官方没有给出具体时间。目前只是通过Fairwind计划面向部分网络安全合作伙伴,后续会先向付费API用户和Google AI Ultra订阅者开放,个人用户还要再等等。
Q: 那它的编程能力到底行不行?
A: 表现不太稳定。DeepSWE v1.1上77.9%的成绩不错,可到了FrontierSWE v2和Terminal-Bench 4.0就垫底了。第三方评分里Text Arena排第一,Code和Agent任务只有第八。只能说常规代码还能应付,复杂工程任务别想着一步到位。
Q: API价格到底便宜多少?
A: 官方定价每百万token输入2美元、输出10美元,缓存命中0.1美元。按首发优惠价算,大概是GPT-6 Astra和Fable 5.1的五分之一,和GPT-6.1 Sol、Sonnet 5.5差不多,在旗舰模型里确实算低价。
关于易枫顺
深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺
来源:爱范儿