返回首页
[ 行业新闻 ] 2026-09-18 13:38

智谱推出GLM-5.3-FlashX:每秒200 token,国产芯片跑出推理新速度

智谱推出GLM-5.3-FlashX:每秒200 token,国产芯片跑出推理新速度

9月18日,智谱AI正式发布GLM-5.3-FlashX,最高生成速度达到每秒200个token,背后的推理算力由10万张国产芯片支撑。目前API已上线,输入价格每百万token 2元,输出7元,支持1M上下文,图片、视频、文件和文本都能直接输入。

从Ox Alpha到FlashX,速度为什么这么关键?

GLM-5.3-Flash之前有个代号叫Ox Alpha,不少开发者用下来觉得顺手,调用量一直往上走。但做模型应用的人都明白,响应速度直接决定用户体验。这次FlashX把每秒生成速度提到200个token,写代码、生成长文本、做实时问答,都能明显感觉到更跟手。

速度提升背后,其实是推理架构做了一次大调整。智谱用10万张国产芯片组成推理集群,同时对基础设施和推理链路做了深度优化。国产芯片能扛住这种规模的工作负载,也意味着大模型推理离自主可控又近了一步。

价格、上下文与多模态,FlashX到底值不值?

API已经开放,模型标识就是GLM-5.3-FlashX。计费方式如下:

  • 输入:每百万token 2元
  • 输出:每百万token 7元
  • 缓存命中:每百万token 0.57元

输入和输出价格比Flash版本高一些,但换来的是更高速度和1M超长上下文,一次性能处理完一整本书的内容。

输入支持图片、视频、文件和文本,等于把多种模态统一在一个接口里。缓存存储限时免费,高频调用的话能省下不少开销。

开发者和企业怎么用最划算?

对于创业团队来说,直接调API是最省事的方案,不用操心GPU和运维。等业务量上来,或者想把模型部署到自有环境,算力成本就会变成大头。这时候可以看看阿里云优惠,用云服务器ECS按需扩容,再结合GLM-5.3-FlashX的API,整体花费比自建机房可控得多。

打算长期跑的企业,可以找像易枫顺 - 阿里云官方旗舰级代理商这样的服务商,商量更合适的混合部署方案。他们熟悉云资源采购,也懂模型调用场景,能少走不少弯路。

FAQ

Q: GLM-5.3-FlashX和GLM-5.3-Flash的区别在哪?

A: FlashX是Flash的提速版,生成速度达到每秒200个token,输入输出价格更高。Flash更便宜,适合成本敏感型场景。

Q: GLM-5.3-FlashX支持哪些输入类型?

A: 支持图片、视频、文件和文本,上下文长度1M。缓存存储目前限时免费,缓存命中每百万token 0.57元。

Q: 在哪里调用GLM-5.3-FlashX的API?

A: 在智谱开放平台选择GLM-5.3-FlashX这个模型标识即可,输入每百万token 2元,输出每百万token 7元。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:IT之家

微信扫码咨询

微信二维码