返回首页
[ 头条新闻 ] 2026-08-25 10:31

DeepSeek V4-Flash-Vision上线,看图只要384token,比GPT省一半还多?

DeepSeek V4-Flash-Vision上线,看图只要384token,比GPT省一半还多?

8月21日,DeepSeek悄悄上线了多模态视觉理解模型V4-Flash-Vision-Exp,API已经开放。看图成本直接压到每张图最多384个token——作为对比,GPT和Claude处理同类图片要吃掉800到1100个token。经常批量分析图片的开发者,一眼就能看出差距。而且这模型不只是会看图,纯文本能力和V4-Flash正式版持平,视觉Agent基准测试也逼近Opus-4.8。

视觉模型上线,价格先“卷”为敬

DeepSeek这次没把视觉能力放到旗舰Pro上,而是先给了Flash。V4-Flash-Vision-Exp的定价和V4-Flash文本模型完全一样,每张图最多按384个token算。而GPT和Claude处理同样的图,至少800 token起步,多的要到1100。算一笔账:同样分析一万张图,DeepSeek的token消耗连对手一半都不到。

调用方式也不复杂。开发者只要在API请求里指定模型名,就能直接传图。图片传入方式支持好几种:URL、base64编码都行。另外DeepSeek还同步推出了Files API,你可以先把图片传上去拿到一个file_id,后续请求直接引用这个ID就行。如果你经常反复分析同一批图片,这个功能能省掉重复上传的麻烦。

实测有点猛:看图、写代码,还能做小游戏

光看参数没意思,实测才有说服力。有人拿《牛来》电影截图试了试,模型能准确识别角色特征,还生成了一张卡通版图像。更狠的是,有人直接从截图里提取元素,让模型生成一个可交互的跑酷HTML小游戏,耗时约36秒。还有测试是给了一张支付产品设计稿截图,模型26秒就生成了完整且样式匹配的响应式HTML页面,还顺手加了动效。

这对前端开发、产品原型验证来说特别实用。以前拿设计稿切图得半天,现在扔给模型,几十秒就能出代码。复杂项目当然还得人工调,但至少起步阶段快多了。

有个坑:思考模式会“吞”输出

不过有个坑得提醒一下。默认的thinking模式下,模型的推理token会把输出预算耗光,导致实际输出为零。说白了,就是模型光顾着“想”,根本没“写”。实测中,同一个任务开着思考模式跑了23秒,结果啥也没返回;关掉思考模式后,7.9秒就搞定了,输出完整。所以如果你只是做视觉理解或代码生成,记得把thinking关掉,不然真就白等了。

官方后面应该会优化这个问题,但现阶段开发者只能自己多留意参数设置。

为什么先上Flash,而不是Pro?

DeepSeek选择用Flash试水视觉能力,逻辑很直接。Flash参数量小,推理成本低,多模态场景下token消耗本来就大,用Flash能压住成本。另外,Harness框架刚新增了原生图片请求支持,正好能配合上。先把视觉能力打磨好,再往Pro上搬,这路线挺稳妥。

对开发者和企业来说,意味着什么?

视觉理解模型的应用场景太广了:截图转代码、图片信息提取、自动化测试、内容审核……如果token成本能压到384,企业上云做AI应用的门槛又低了一截。当然,模型部署和API调用需要稳定的服务器资源,可以考虑易枫顺 - 阿里云官方旗舰级代理商。预算敏感的话,记得留意阿里云优惠,能省不少。

常见问题

Q: DeepSeek V4-Flash-Vision-Exp怎么调用?

A: 在API请求里指定模型名就行。图片可以用URL或base64传,也可以先用Files API上传拿到file_id,后面直接引用。

Q: 这个模型的视觉理解成本真的比GPT低吗?

A: 官方定价和V4-Flash文本模型一样,每张图片最多384个token;GPT和Claude处理同等图片要800到1100个token。确实低不少。

Q: 为什么关闭思考模式后效果更好?

A: 因为默认thinking模式下,推理token会耗尽输出预算,导致实际输出为零。关掉之后,同一任务从23秒降到7.9秒,输出也完整。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:极客公园

微信扫码咨询

微信二维码