返回首页
[ 行业新闻 ] 2026-08-15 16:25

AICon 深圳站:庄博涵谈多模态推理高效长上下文建模,三大硬核技术破解效率难题

AICon 深圳站:庄博涵谈多模态推理高效长上下文建模,三大硬核技术破解效率难题

AICon 全球人工智能开发与应用大会定在 8 月 21 日至 22 日深圳举办,完整日程现已放出。浙江大学百人计划研究员庄博涵将登台分享《面向多模态推理的高效长上下文建模》,核心思路是算法和基础设施协同设计——用稀疏注意力、KV-cache 压缩、并行解码这些手段,把视频生成和推理的延迟压下去。像注意力算子最高加速 7.09 倍、端到端视频生成加速 4.96 倍这些数字,都是团队在真实硬件上跑出来的,不是纸面推算。

大会看点:多模态推理是绕不开的话题

今年的 AICon 深圳站,议题覆盖大模型应用、Agent、多模态、推理优化这些热门方向。庄博涵的演讲被安排在关键时段,原因很直接:多模态推理的长上下文问题,卡住了不少团队。图片、视频、音频混在一起,序列长度动不动就上万 token,传统注意力机制的计算量随序列长度平方级上涨,显存也吃不消。庄博涵团队的做法是算法和硬件两头一起改,而不是靠单一技巧硬扛。

三个硬核技术:FPSAttention、Mirage 与 TriAttention

庄博涵的分享里,这几个技术名字可能有点陌生,但效果很直接。FPSAttention 专门优化注意力算子,在 NVIDIA H20 上跑 Wan2.1-14B 生成 720p 视频时,注意力部分最高提速 7.09 倍,整个视频生成流程也快了 4.96 倍。背后的思路是稀疏注意力和线性注意力组合,把无关计算砍掉,只保留关键路径。

  • FPSAttention:针对视频生成中的注意力瓶颈,在 H20 上实现算子级 7 倍以上加速。
  • Mirage:把视频模型的空间记忆挪到潜空间里,三维缓存显存占用最高降 55 倍,端到端加速最高 10 倍。显存省下来,就能塞更长视频或更高分辨率。
  • TriAttention:在 AIME25 的 32K token 生成实验里,准确率跟完整注意力相当,同时吞吐提升 2.5 倍,或者 KV-cache 显存压缩 10.7 倍。这个技术对长文本推理特别有用,比如数学竞赛题那种需要反复思考的场景。

大小模型协同:R-Stitch 与 Agent-as-a-Router

除了单模型优化,庄博涵团队也在探索大小模型配合的路线。R-Stitch 在不同尺寸模型的推理任务上实现了 3-4 倍加速,思路是把大模型的部分计算拆给更小的模型,同时尽量不牺牲质量。Agent-as-a-Router 则更像一个调度员,在 2900 个编码任务上,用低于 opus 一半的成本拿到了更高的平均得分。这种协同方案,对成本敏感的团队来说很有参考价值。

落地痛点:效率与质量的拉锯战

技术再漂亮,落地时总有几个绕不开的坑。庄博涵在演讲里会直说这些痛点:效率技术往往带来质量损失,压缩 KV-cache 可能丢掉细节,稀疏注意力可能忽略关键 token。另外,多模态 Agent 的评测也很麻烦,理解、生成、世界模型各有一套标准,很难用单一指标衡量。他会在现场聊聊自己踩过的坑和权衡思路。

FAQ

Q: 庄博涵在 AICon 深圳站的演讲主题是什么?

A: 演讲题目是《面向多模态推理的高效长上下文建模》,主要讲算法与基础设施协同设计,包括稀疏/线性注意力、KV-cache 压缩、并行解码等效率技术,也会聊到落地中的质量与成本权衡。

Q: FPSAttention 在视频生成上能带来多少加速?

A: 在 NVIDIA H20 上运行 Wan2.1-14B 生成 720p 视频时,注意力算子最高加速 7.09 倍,端到端视频生成加速 4.96 倍。

Q: Mirage 技术解决什么问题?

A: Mirage 把视频模型的空间记忆存到潜空间,让三维缓存显存占用最高降低 55 倍,端到端加速最高 10 倍,适合长视频或高分辨率生成场景。

Q: AICon 大会具体什么时候在深圳举办?

A: 8 月 21 日至 22 日,地点在深圳。目前全部日程已公布,可以到官网查看详细安排。

来源:InfoQ

微信扫码咨询

微信二维码