返回首页
[ 行业新闻 ] 2026-09-09 13:37

QCon上海站2026:AI时代的软件工程实践,Open Code Review百万真实任务验证Agent协同

QCon上海站2026:AI时代的软件工程实践,Open Code Review百万真实任务验证Agent协同

今年10月22日至24日,QCon全球软件开发大会上海站将如期举办,主题为“AI时代的软件工程实践”。阿里巴巴高级研发工程师李峥峰,将分享《Open Code Review:百万真实任务验证的确定性工程与Agent协同》,并基于阿里内部2万多名开发者的真实数据,把AI代码评审落地讲透。

通用Agent做代码评审,卡在哪?

大模型能写代码,已经不算新鲜事。真正难的是让它在真实工程环境里从“看得懂”变成“靠得住”。李峥峰这次分享,上来就要拆一个硬问题:通用Agent怎么才能变成专攻代码评审的垂直Agent?

背后的痛点也很具体:规则模板引擎需要人工不断维护,遇到没见过的代码模式基本不会泛化;度量体系里的基准标注成本高,线上环境一变,旧基准立刻过时。这些坑,做过研发工具的人一听就懂。

百万真实任务里,藏着哪些关键实践?

李峥峰给出的答案是“确定性工程+Agent协同”。不是拿一个通用大模型直接硬怼,而是一层层拆出可复用、可验证的工程方法。下面是分享中会展开的核心技术实践:

  • 分治并发:把复杂代码评审任务拆成小块,并行处理再汇总,避免单次上下文爆炸。
  • 精准定位:先用工具链锁定可疑变更,再让Agent深入分析,而不是全仓乱扫。
  • 规则模板引擎:把沉淀的经验固化成规则,同时保留Agent泛化能力去覆盖未知问题。
  • 工具链蒸馏:把散落的各种静态检查、测试、lint工具,蒸馏成Agent能高效调用的“武器库”。
  • 上下文分层管理:按文件、函数、变更范围分层组织上下文,减少无关信息干扰。

这套打法不是实验室里的demo。分享中的数据显示,阿里内部有超过2万名开发者参与使用,验证任务量达到百万级。Open Code Review项目和AACR-Bench基准也会被一并拿出来讨论,相当于给整个行业留了可复用的工具箱。

采纳率失效之后,Review评估体系要变

AI深度参与研发后,原来的尺子可能不准了。比如“采纳率”高,一定程度上说明AI说得有道理,但开发者也可能只是懒得跟AI争;再看“AI评论占比”,如果模型为了刷存在感频繁插话,这个数字越高反而越糟。

李峥峰会聊到建立新AI Review评估体系的必要性。关键是别拿旧度量标准硬套新工具,得先从真实问题出发,定义什么评论算有效、什么时机给建议最合适、哪些误报可以容忍。这套体系一旦跑通,AI代码评审才能从“看着热闹”变成“真省事”。

AI代码评审落地,离不开稳定云底座

要把Open Code Review这类方案真正在企业里跑起来,光有算法和模型还不够。代码评审Agent需要持续拉取代码、跑静态分析、做并发推理,这些都需要弹性的云资源支撑。云服务器ECS是很多团队的首选,而企业上云最关心的成本和运维问题,则可以交给专业的阿里云代理商来打包解决。靠谱的阿里云代理商会整理最新阿里云优惠和阿里云代金券,让企业在预算内把AI研发平台搭稳。像易枫顺 - 阿里云官方旗舰级代理商这样的角色,不只是卖资源,还能帮助企业做架构选型和迁移托管,省下不少试错成本。

FAQ

Q: Open Code Review是什么?

A: 它是阿里在代码评审场景中沉淀的一套方法与实践,结合确定性工程和Agent协同,把通用大模型改造成更懂代码评审的垂直Agent,相关项目已开源,方便团队直接使用或二次开发。

Q: AACR-Bench基准的作用是什么?

A: AACR-Bench用于衡量代码评审Agent的真实效果。以往基准标注成本高、更新慢,AACR-Bench希望用更贴近生产环境的任务,给AI评审能力一个相对可靠的标尺。

Q: 为什么说采纳率和AI评论占比不能完全相信?

A: 采纳率受开发者惰性影响,AI评论占比可能被“话痨”模型人为拉高。只有结合误报率、有效建议率、评审耗时等维度,才能看清AI到底有没有帮上忙。

关于易枫顺

深圳市易枫顺网络科技有限公司是阿里云官方旗舰级代理商。提供云服务器ECS、云数据库RDS、对象存储OSS等阿里云全系产品官方特惠折扣与代金券申请,以及多云成本优化、企业上云一站式服务。客服热线:19520841949 - 易枫顺

易枫顺 - 阿里云官方旗舰级代理商

来源:InfoQ

微信扫码咨询

微信二维码