摘要
- AI 辅助导致开发者技能掌握程度显著下降:使用 AI 的参与者测验得分比手写代码组低 17%,相当于近两个等级的差距
- 并非所有 AI 使用方式都会阻碍学习:追问解释、独立探索概念的参与者保持了较高的理解水平
- 调试能力受影响最大:AI 组在调试题目上的分数差距最为突出,这对监督 AI 生成代码的能力构成隐忧
- 低分模式表现为大量认知卸载(如完全委托 AI 写代码),高分模式则将 AI 用于辅助理解而非替代思考
- 企业在推进 AI 编程工具时,需在生产力提升与初级工程师技能发展之间做出审慎权衡
文章信息
- 来源: Anthropic Research
- 发布日期: 2026-01-29
- 原文: English Original
研究表明,AI 能够帮助人们更快地完成工作任务。一项针对 Claude.ai 数据的观察性研究发现,AI 可以将某些任务的完成时间缩短 80%。然而,这种生产力提升也引发了疑问:当人们使用 AI 辅助时,他们对工作的投入度会降低,付出的努力也会减少——本质上是将思考过程卸载给了 AI。
目前尚不清楚这种认知卸载是否会阻碍技能发展,或者——具体到编程领域——是否会影响对所构建系统的理解。这项针对软件开发者的随机对照实验旨在探究职场 AI 使用的潜在负面影响。
这个问题对 AI 产品设计、职场政策和社会韧性都有广泛的影响。编程正是这种张力的典型代表:随着自动化提升工作速度,人类仍然需要具备发现错误、引导输出、在高风险环境中监督 AI 的技能。AI 是同时为技能发展和效率提供了捷径,还是生产力的提升反而损害了技能的形成?
研究人员考察了两个问题:1)在有 AI 辅助和无 AI 辅助的情况下,软件开发者掌握新技能的速度如何?2)AI 的使用是否降低了对代码的理解能力?
核心发现: AI 辅助导致了具有统计学显著性的技能掌握度下降。使用 AI 的测验参与者得分比手写代码组低 17%——相当于近两个等级的差距。AI 略微加快了任务完成速度,但未达到统计学显著水平。
值得注意的是,使用 AI 并不必然导致低分。参与者与 AI 的交互方式影响了信息的留存程度。那些表现出更高掌握度的参与者,通过追问、请求解释和独立探索概念来利用 AI 构建理解。
研究人员招募了 52 名主要为初级的软件工程师,他们具有一年以上的 Python 周常使用经验。参与者对 AI 辅助编程有一定了解,但对研究中使用的 Python 库 Trio 并不熟悉。
研究分为三个部分:热身环节;主任务——使用 Trio 编写两个功能(需要异步编程知识);以及评估环节。参与者被告知后续会有测验,但也被鼓励尽快完成任务。
编码任务模拟了自主学习工具的过程。参与者收到了问题描述、初始代码和 Trio 概念说明。在线平台配有一个可以访问代码的 AI 侧边栏助手,能够在被要求时生成正确的解决方案。
评估借鉴了计算机科学教育研究中确定的四种技能掌握度题型:
调试: 识别和诊断代码错误——这对于发现 AI 生成代码中的错误、理解故障原因至关重要。
代码阅读: 理解代码的功能——使开发者能够在部署前验证 AI 编写的代码。
代码编写: 编写或选择正确的编码方法——随着 AI 进一步融入开发流程,底层语法的重要性将低于高层系统设计。
概念理解: 理解工具和库的核心原理——对于评估 AI 生成的代码是否采用了符合库设计意图的恰当设计模式至关重要。
评估侧重于调试、代码阅读和概念理解题目,认为这些对于监督日益增多的 AI 生成代码最为重要。
AI 组参与者完成任务大约快两分钟,但未达到统计学显著水平。然而,测验得分的差异具有显著性:AI 组平均得分 50%,手写代码组为 67%——相当于近两个等级的差距(Cohen's d=0.738, p=0.01)。调试题目的分数差距最大,这表明当 AI 阻碍了技能发展时,理解代码错误的能力尤其令人担忧。
研究人员手动标注了屏幕录制,分析了查询组织时间、问题类型、错误情况和主动编码时长。
令人意外的是,参与者花了大量时间与 AI 助手交互——有些人花了 11 分钟(占分配时间的 30%)编写多达 15 个查询。这解释了为何尽管生产力提升不显著,平均加速效果仍然不大。AI 在重复性或熟悉的任务上可能会带来更大的生产力提升。
不出所料,无 AI 组的参与者遇到了更多错误——语法错误和 Trio 概念错误恰好对应了评估题目的内容。研究人员假设,对照组参与者通过独立解决错误提升了调试能力。
研究人员根据 AI 交互模式对参与者进行了分组,识别出不同的完成时间和学习效果。
低分模式的平均得分低于 40%,表现为对 AI 的高度依赖、较少的独立思考和更多的认知卸载:
高分模式的平均得分在 65% 或以上:
定性分析无法建立交互模式与学习之间的因果关系,但识别出了与不同结果相关联的行为特征。
研究结果表明,在职场中积极推行 AI——尤其是在软件工程领域——涉及取舍。并非所有 AI 依赖都是等价的:在追求效率的过程中,交互方式会影响学习量。在时间和组织压力下,初级开发者可能会优先追求速度而忽视技能发展——尤其是调试能力会受到显著影响。
这些初步结果提示,企业在向更高 AI 代码占比转型时需要审慎考虑。生产力提升的代价可能是验证能力的削弱——当初级工程师的成长受到阻碍时尤为如此。管理者在大规模部署 AI 工具时应有意识地建立保障机制,确保工程师持续学习并对系统保持有效的监督。
对于新手开发者而言,这项研究证明了有意识地培养 AI 工具使用技能的价值。认知努力——即使是痛苦的挣扎——很可能对技能掌握至关重要。这适用于个人对 AI 协作方式的选择以及工具的选择。主流大语言模型服务已提供"旨在促进理解的学习模式"。理解 AI 对学习的影响可以指导产品设计:"AI 辅助应当使人们在更高效工作的同时,也能发展新技能。"
此前的研究显示 AI 对生产力的影响不一。Anthropic 此前的研究发现 AI 可将某些任务时间减少 80%——这似乎与本研究的发现相矛盾。但两项研究提出了不同的问题,采用了不同的方法:早期的观察性研究衡量的是在熟悉技能上的生产力,而本研究考察的是新技能的学习。AI 可能同时加速已有技能的生产力并阻碍新技能的习得,这需要进一步的研究来验证。
本研究是人机协作对工作者体验影响的初步探索。样本量相对较小,且在编码完成后不久即进行了理解度测评。即时测验成绩是否能预测长期发展仍是未解之题。未来的研究应探索 AI 对编程以外领域的影响、长期效应的演变,以及 AI 辅助与人类辅助之间的差异。
归根结底,在 AI 时代兼顾技能发展需要对工作者影响持更广阔的视角。AI 增强的职场既受益于生产力的提升,也需要培养支撑这些提升的专业能力。
Judy Hanwen Shen 和 Alex Tamkin 领导了这个项目。Jake Eaton、Stuart Ritchie 和 Sarah Pollack 提供了编辑支持。
Ethan Perez、Miranda Zhang 和 Henry Sleight 通过 Anthropic 安全研究员项目为本研究提供了支持。Matthew Jorke、Juliette Woodrow、Sarah Wu、Elizabeth Childs、Roshni Sahoo、Nate Rush、Julian Michael 和 Rose Wang 提供了实验设计反馈。