作者 / 来源:中智凯灵 / AiDD

——第10 届AiDD 北京站大会观察(2):重新理解 AI 时代的质量工程
▼
当 AI 让一名开发者三天完成过去一个月的工作,测试团队还能靠“最后集中测一轮”接住这些代码吗?
第 10 届 AI+研发数字峰会(AiDD 2026 北京站)上,Testin 云测 CEO 徐琨在《研发已提速 10 倍,测试怎么办?》中引用了三组放在一起颇有张力的数据:生产代码中由 AI 自主生成的比例约为 35%;变更失败率同比上升 30%;代码行数达到过去的 17.3 倍,发布版本却只提升约 30%。
这些数字不是为了证明 AI Coding 带来了必然的质量下降,而是提醒我们:生产速度和交付能力并不会自动同步。 当代码生成、任务拆解和自动执行都在加速,需求澄清、验收标准、测试执行、风险评估和发布治理如果仍按原来的节奏运行,质量体系就会成为新的拥堵段。

图 1:徐琨《研发已提速 10 倍,测试怎么办?——从错判到重构:AI 测试这两年我看到的三件事》:研发提速带来的质量连锁反应(PPT 第 6 页)
这也是北京站多场质量与工程分享共同指向的变化:质量不能继续被理解为研发流程末端的一次“检查”,而要变成贯穿业务意图、验收规格、Agent 执行环境、持续评测和权限治理的证据系统。
从质量左移到 ATDD,从 Harness Engineering 到 AgentOps,这些看似属于不同论坛的概念,实际上可以串成一条完整的工程链路。
一、研发提速之后,最危险的不是测试变慢,而是反馈来得太晚
传统研发节奏里,测试常常被安排在开发完成之后:需求确定、代码提交、功能集成,再由测试团队集中验证。只要版本变化相对有限,这种“末端关卡”还能通过排期、加人和回归周期维持。
但 AI 改变的不是某一个节点的速度,而是变更的数量、粒度和频率。代码可以在更短时间内大量生成,PR 更密集,Agent 可以连续修改多个文件、调用工具并推进长任务。过去一周一次的大变更,可能变成一天几十次小变更;过去由开发者亲手完成、因而带着隐性上下文的代码,现在可能来自不同模型、不同会话和不同 Agent。
这时,如果质量信号仍然等到集成测试或上线前才出现,问题就不仅是“测试来不及”,而是错误已经沿着更长的链路扩散。需求中的一个边界条件没有说清,可能迅速生成错误规格、错误实现和错误用例;一次工具调用越权,可能在测试介入前已经修改了真实状态;一个看似通过的 Agent 任务,可能只是输出了“All done”,实际并未完成目标。
因此,AI 时代的质量矛盾不是“开发和测试谁更快”,而是质量反馈能否和机器生成、机器执行保持同一个节拍。质量体系必须从周期末端的集中检测,转向每一次意图表达、每一次变更、每一步执行都能得到及时反馈。
二、质量左移,不是让测试更早加班,而是让风险在源头变成可计算对象
京东健康李勋在《重塑质量体系:AI 赋能质量左移与研发风险管控平台》中,把质量管控的变化概括为四个转向:从事后测试走向需求阶段介入,从单一文本或代码走向多模态信息覆盖,从人工决策走向 AI 闭环与人机协同,从通用模型走向质量领域能力。

图 2:李勋《重塑质量体系:AI 赋能质量左移与研发风险管控平台》:质量管控从事后测试走向全链路左移(PPT 第 10 页)
这里的“左移”很容易被误解成把测试活动简单提前。真正的质量左移,并不是让测试人员更早拿到一份仍然模糊的需求,而是把过去依赖专家经验识别的风险,转成可以被机器读取、分析、分级和追踪的结构化对象。
一份 PRD 进入研发流程时,系统就应该能够追问:业务边界是否完整,异常路径是否定义,资金与合规风险是否覆盖,历史故障是否再次出现,变更会影响哪些模块,什么条件下必须转人工评审。风险一旦被识别,就要有等级、责任人、关闭条件和验证证据,而不是停留在评审会上的一句提醒。
李勋展示的全流程框架从 PRD 产出开始,经过需求评审与风险分析、安全管控、测试计划、用例生成、自动执行、白盒测试、Code Review、缺陷分析和测试报告,最后由 AI 准出机制完成收口。它表达的关键变化是:质量不再是测试阶段的一道关卡,而是一条贯穿研发全流程的自动流水线。

图 3:李勋《重塑质量体系:AI 赋能质量左移与研发风险管控平台》:从 PRD 到准出报告的全流程质量闭环(PPT 第 11 页)
左移的价值也不只是“更早发现缺陷”。它让质量第一次有机会进入需求、设计和开发的共同语言:什么必须被满足,什么风险不可接受,哪些证据足以证明完成。接下来,ATDD 要解决的,就是如何把这套共同语言变成可执行契约。
三、ATDD 的核心,不是多生成测试用例,而是先让“做对”有统一定义
AI Coding 最容易制造一种错觉:既然代码可以自动生成,测试用例也可以自动生成,那么需求到交付的链路应该很快就能自动跑通。
中兴通讯 AI 应用(软件)资深专家高林林在《基于智研的 ATDD 端到端实践》中给出了一个更谨慎的判断:AI 的单点能力越强,端到端交付的信任裂缝反而可能越大。
他把 ATDD 链路中的问题拆成三个断裂点。第一,规格源头模糊,AI 只能根据半截信息“猜”验收标准;第二,长程任务执行不稳定,解析规格、生成用例、部署环境、执行验证之间容易跳步、死循环或虚假完成;第三,验收发生在“真空”里,生成的接口、参数和断言并没有进入真实环境验证。

图 4:高林林《基于智研的 ATDD 端到端实践》:ATDD 链路中的规格、执行和验证三个信任断裂点(PPT 第 8 页)
这三个断裂点说明,ATDD 不能被简化成“AI 帮测试写 Case”。它首先要把业务意图转成结构化、可执行的验收规格:输入是什么,前置条件是什么,哪些业务规则必须满足,异常如何处理,什么结果算通过。需求、开发、测试和 Agent 必须围绕同一份规格工作,而不是各自解释一遍需求。
高林林给出的三层重构很形象:用业务语义库给 AI 配“翻译”,让企业术语、接口契约、状态流转和规则有据可查;用编排引擎铺“铁轨”,让确定性流程不由概率模型自由发挥;用真实环境与质量看板配“检验员”,让每个结果都有可复核证据和人机决策动作。
这套机制在试点中的价值,不是生成了更多用例,而是端到端成功率逐月提升。分享中的近四个月数据里,用户故事 ATDD 端到端成功率从 43.84% 提升至 66.67%,市场需求链路也从 0 开始提升至 24.73%。这个过程并不完美,却比“用例生成率很高”更接近真实交付,因为它度量的是需求最终有没有通过真实验收。

图 5:高林林《基于智研的 ATDD 端到端实践》:近四个月 ATDD 端到端成功率与缺陷修复趋势(PPT 第 34 页)
ATDD 由此完成了一次角色转换:它不再只是测试方法,而是业务意图进入工程系统的质量契约。但有了契约还不够,Agent 必须在一个能够读取事实、受约束地行动并自动验证的环境里执行它。这正是 Harness 要补的下一层。
四、Harness 的任务,是让 Agent 不能只靠“自我感觉完成了”
中国移动云公司 AI 技术研究员张燚钧在《移动云基于 Harness 的 AI 原生开发实践》中,把 Harness 定义为一套可工作的研发环境,而不是套在模型外面的壳。
这套环境至少包含五层:知识层让需求、架构、规范和历史决策可被 Agent 发现;约束层把权限、安全、架构不变量和编码规范变成机器可执行边界;执行层让 Agent 能访问代码、终端、服务和测试环境;验证层用测试、静态检查、性能基准、独立 Review 和人工门禁提供证据;反馈层则让失败可以定位、回写和重新运行。

图 6:张燚钧《移动云基于 Harness 的 AI 原生开发实践》:Harness 以知识、约束、执行、验证和反馈构成可工作的研发环境(PPT 第 7 页)
它解决的是 ATDD 契约落地后的执行问题。Spec 告诉 Agent 什么算完成,Harness 则决定 Agent 能看到什么、能调用什么、必须经过哪些步骤、拿出什么证据才能宣布完成。
这一区分非常重要。模型擅长理解需求、提出方案和生成实现,但流程状态、重试次数、权限范围、质量阈值和停止条件不应该交给模型临场决定。越是确定性的工程要求,越应该固化在脚本、CI、规则、沙箱和门禁中;越是需要语义判断的部分,才交给模型和人协同完成。
因此,Harness 不是限制 Agent 的创造力,而是给创造力划出一个可交付的运行空间。Agent 可以自主选择实现路径,但不能越过高危操作边界;可以不断修复失败,但不能跳过验证步骤;可以生成大量代码,但必须通过独立、可重复的检查。质量从“结果出来后再看”变成“执行过程中不断出示证据”。
五、持续评测,不是上线前跑一次分,而是让每次变更都能被比较和回归
当 Agent 进入生产环境,质量问题还会发生一次变化。传统软件的输入、状态和路径相对稳定,Agent 的表现却同时受到模型、Prompt、知识库、Skill、工具、记忆、上下文和业务数据影响。任何一项发生变化,都可能让原来通过的场景退化。
阿里云高级产品专家夏明在《Agent 自进化:企业级智能体全生命周期进化飞轮实践》中提出,生产级 Agent 的效果不是一次“调”出来的,而是跑出来、评出来、改出来、回归出来的。围绕真实运行轨迹,企业需要完成采集、观测、审计、轨迹处理、数据管线、题库、评估、归因、调优和回测十个步骤。

图 7:夏明《Agent 自进化:企业级智能体全生命周期进化飞轮实践》:以运行轨迹为事实底座的 Agent 数据飞轮(PPT 第 9 页)
持续评测的关键,是把“看起来不错”拆成不同类型的证据。基准集用于模型切换和大版本比较,测试集收纳低分样本与 Bad Case,回归集防止 Prompt、Skill、Tool 或知识库变更带来退化,后训练集则沉淀高质量轨迹和专家标注。评估也不能只比文本相似度,而要检查任务是否完成、工具是否正确调用、规则是否遵守、成本与时延是否可接受、过程是否安全。
评测之后还必须归因。一个低分结果究竟来自提示词不清、工具误选、知识过期、规划遗漏、记忆污染、模型边界,还是规则缺口?只有定位到可行动的原因,评测才会从“质量报表”变成改进机制。
更重要的是,每次优化都不能直接全量上线。固定回归集、离线对比、小流量 A/B、统一变更门禁和灰度发布,构成了 Agent 版本的发布证据链;任何核心指标未达阈值,都应该阻断或回滚。

图 8:夏明《Agent 自进化:企业级智能体全生命周期进化飞轮实践》:从离线回归、A/B 到变更门禁和灰度发布的 Agent 实验回测(PPT 第 26 页)
这意味着质量体系的时间边界被彻底打破:上线不再是测试工作的终点,而是下一轮观测、评估和改进的起点。
六、当 Agent 能调用工具,质量最终会走向治理
如果 Agent 只生成文本,质量问题主要是答案是否准确;当 Agent 能调用数据库、修改文件、发布服务、分派子任务并与其他 Agent 协作,质量就必然进入身份、权限、运行时和审计治理。
阿里云产品解决方案架构师、AgentTeams 开源 Maintainer 王泉力在《AgentTeams——多 Agent 治理管控与协作平台》中展示了四道信任边界:AI 网关统一托管身份与凭证,沙箱隔离运行时和爆炸半径,通信协议保障协作过程加密且可追溯,Skill 与 MCP 资产经过审核、授权和分组管理。

图 9:王泉力《AgentTeams——多 Agent 治理管控与协作平台》:从身份、运行时、通信到 AI 资产管理的四道治理防线(PPT 第 11 页)
这些机制看似更接近安全,其实也是质量体系的一部分。因为“做对”从来不只意味着结果正确,还意味着在正确身份下、使用正确权限、调用可信工具、遵守规定流程,并留下可审计证据。
多 Agent 场景尤其如此。一个 Manager Agent 把任务拆给多个 Worker,如果没有统一身份、任务状态、调用日志、人工打断和结果审计,协作规模越大,失败越难定位,责任越难划分。治理不是等 Agent 出事后再加的一层审批,而是生产级执行从一开始就必须具备的运行条件。
至此,一条完整的 AI 质量链路才真正闭合:质量左移负责尽早识别风险,ATDD 把业务意图变成验收契约,Harness 提供受控且可验证的执行环境,持续评测把真实运行变成改进数据,Agent 治理则守住身份、权限、审计和人工责任边界。
结语:未来的质量体系,本质上是一套持续生成证据的系统
研发提速 10 倍之后,企业当然需要更智能的测试工具,但仅仅把最后一道测试也提速 10 倍,并不能解决问题。
因为新的质量问题已经不只发生在代码完成以后。它可能发生在业务意图被误读时,发生在规格缺少边界时,发生在 Agent 跳过步骤时,发生在工具调用越权时,也可能发生在一次看似正向的优化让旧场景悄悄退化时。
质量体系因此必须改变自己的形态:从一个阶段,变成一条贯穿始终的证据链;从测试团队的独立职责,变成需求、研发、测试、平台、安全和业务共同维护的工程系统;从“上线前证明这次没问题”,变成“每一次运行都留下事实,每一次变化都经过比较,每一次失败都能推动下一轮改进”。
测试岗位不会因为 AI 消失,但测试的价值会继续上移。重复执行和基础脚本会越来越多地交给工具,真正稀缺的将是定义验收标准、设计质量策略、识别系统性风险、构建评测集、校准自动评估、设置治理边界,以及对最终结果承担判断责任的人。
AI 把“生产”变快了,质量工程接下来要做的,是让组织拥有与这种速度相匹配的验证能力。
不是在最后一道测试里拼命追赶,而是让质量从第一条需求开始,就和交付一起向前走。
• 徐琨:《研发已提速 10 倍,测试怎么办?——从错判到重构:AI 测试这两年我看到的三件事》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 21 日。
• 李勋:《重塑质量体系:AI 赋能质量左移与研发风险管控平台》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 21 日。
• 高林林:《基于智研的 ATDD 端到端实践》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 21 日。
• 张燚钧:《移动云基于 Harness 的 AI 原生开发实践》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 22 日。
• 夏明:《Agent 自进化:企业级智能体全生命周期进化飞轮实践》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 22 日。
• 王泉力:《AgentTeams——多 Agent 治理管控与协作平台》,第 10 届 AI+研发数字峰会(AiDD 2026 北京站),2026 年 8 月 21 日。