摘要
- AI 流利度最常见的表现形式是"增强式"使用——将 AI 视为思维伙伴,而非完全委托工作;这类对话中的流利度行为数量是简短对话的两倍以上
- 迭代与优化是与所有其他流利度行为关联最强的单一因素:85.7% 的样本对话展现了这一特征
- 当 AI 生成代码、文档等成品时,用户反而更少质疑其推理(-3.1pp)或识别遗漏背景(-5.2pp),呈现"越精美越不审视"的现象
- 仅 30% 的对话中用户会主动设定与 AI 的协作方式,这是一个普遍的提升空间
- 本研究为追踪 AI 流利度随时间演变提供了基线数据,未来将扩展到队列分析、定性研究和因果关系探索
文章信息
- 来源: Anthropic Research
- 发布日期: 2026-02-23
- 原文: English Original
人们将 AI 工具融入日常生活的速度,即使在一年前也难以预料。但仅凭采用率本身并不能告诉我们多少关于这些工具影响力的信息。一个同样重要的进一步问题是:随着 AI 成为日常生活的一部分,人们是否在培养善用 AI 的能力?
此前的 Anthropic 教育报告研究了大学生和教育工作者如何使用 Claude。我们发现学生用它来撰写报告和分析实验结果;教育者用它来制作课程材料和自动化日常工作。但我们知道,任何使用 AI 的人都可能在自己的工作中有所提升。我们希望进一步探索这一点,并了解使用 AI 的人如何随着时间推移发展出对这项技术的"流利度"。
在本报告中,我们开始回答这个问题。我们在大量匿名对话样本中,追踪一系列被我们视为 AI 流利度代表的行为分类体系中各项行为的出现与否。
与我们最近发布的经济指数一致,我们发现 AI 流利度最常见的表现形式是增强式的——将 AI 视为思维伙伴,而非完全委托工作。事实上,这类对话所展现的 AI 流利度行为数量是快速简短对话的两倍以上。
但我们也发现,当 AI 生成成品——包括应用程序、代码、文档或交互式工具时——用户更不太可能质疑其推理(-3.1个百分点)或识别遗漏的背景信息(-5.2个百分点)。这与我们最近关于编程技能研究中观察到的相关模式一致。
这些初步发现为我们提供了一个基线,我们可以用它来研究 AI 流利度随时间的发展变化。
为了量化 AI 流利度,我们采用了 4D AI 流利度框架,该框架由 Rick Dakan 教授和 Joseph Feller 教授与 Anthropic 合作开发。这个框架帮助我们定义了 24 种我们认为体现安全有效的人机协作的具体行为。
在这 24 种行为中,有 11 种(列于下图中)可以在人与 Claude 在 Claude.ai 或 Claude Code 上的交互中直接观察到。其余 13 种(包括诚实说明 AI 在工作中的角色、考虑分享 AI 生成内容的后果等)发生在 Claude.ai 聊天界面之外,因此我们很难追踪。这些不可观察的行为可以说是 AI 流利度中最具影响力的维度之一,因此在未来的工作中,我们计划使用定性方法来评估它们。
在本研究中,我们聚焦于这 11 种可直接观察的行为。我们使用隐私保护分析工具,研究了 2026 年 1 月一周时间窗口内,在 Claude.ai 上与 Claude 进行多轮对话的 9,830 段对话。然后我们衡量了这 11 种行为的出现与否;每段对话可以展现多种行为的证据。我们通过检查结果在一周中每天以及样本中不同语言间是否一致来评估样本的可靠性(结果确实一致)。最终,这给出了 AI 流利度指数:对当今人们如何与 AI 协作的基线衡量,以及追踪这些行为随模型变化而演变的基础。
9,830 段 Claude.ai 对话中各 AI 流利度行为指标的普及率,按从最常见到最不常见排列,并按能力维度用颜色编码。
通过首次研究,我们发现了 Claude 使用中的两个主要模式:AI 流利度与通过更长对话进行迭代优化之间的强关联,以及用户在编程或构建其他产出时流利度行为的变化。
数据中最突出的模式之一是迭代与优化和所有其他 AI 流利度行为之间的关系。我们样本中 85.7% 的对话展现了迭代和优化:在先前交流的基础上完善用户的工作,而不是接受第一个回复就转向新任务。如下图所示,这些对话表现出显著更高的其他流利度行为出现率:
在用户进行迭代和优化的对话(n=8,424)与未进行迭代和优化的对话(n=1,406)中各行为指标的普及率对比。所有行为在有迭代和优化的对话中都明显更为普遍。
平均而言,有迭代和优化的对话额外展现 2.67 种流利度行为——大约是非迭代对话 1.33 的两倍。这在与评估 Claude 输出相关的流利度行为中尤为明显。有迭代和优化的对话中,用户质疑 Claude 推理的可能性高出 5.6 倍,识别遗漏背景的可能性高出 4 倍。
我们样本中 12.3% 的对话涉及成品,包括代码、文档、交互式工具和其他产出。在这些对话中,人们与 AI 的协作方式有着明显不同。
具体而言,我们发现在"描述"和"委托"这两个更广泛主题下的行为出现率显著更高。例如,与非成品对话相比,这些对话中用户更可能明确目标(+14.7个百分点)、指定格式(+14.5个百分点)、提供示例(+13.4个百分点)并进行迭代(+9.7个百分点)。换言之,他们在工作开始时投入了更多精力来引导 AI。
但这种指导性并没有带来更高水平的评估或鉴别。事实恰恰相反:在创建成品的对话中,用户更不太可能识别遗漏的背景信息(-5.2个百分点)、核查事实(-3.7个百分点)或通过要求 AI 解释其逻辑来质疑模型的推理(-3.1个百分点)。 我们的经济指数发现——不出所料——最复杂的任务正是 Claude 最吃力的地方,因此这一点尤其值得关注。
有成品的对话(n=1,209)与无成品的对话(n=8,621)中各行为指标的普及率对比。描述和委托类行为在成品对话中增加,而所有三种鉴别类行为均有所下降。
对于这一模式有几种可能的解释。可能是 Claude 创建了看起来精美、功能完备的产出,用户觉得没有必要进一步质疑:如果工作看起来已经完成了,用户可能就直接当它完成了。但也有可能成品对话涉及的任务中,事实精确性不如美观或功能重要(例如设计 UI 界面,而非撰写法律分析)。或者用户可能通过我们无法观察到的渠道来评估成品——运行代码、在其他地方测试应用、与同事分享草稿——而不是在同一段初始对话中表达他们的评估。
无论解释是什么,这个模式都值得关注。随着 AI 模型越来越有能力产出看起来精美的成果,批判性评估这些产出的能力——无论是在直接对话中还是通过其他方式——只会变得更加而非更少重要。
与所有技能一样,AI 流利度是一个程度问题——对大多数人来说,进一步提升自己的技巧是完全可能的。基于我们数据中的模式,我们发现了三个许多用户可以提升技能的领域:
持续对话。 迭代和优化是我们数据中与所有其他流利度行为关联最强的单一因素。因此,当你收到初始回复时,值得将其视为起点而非终点:提出后续问题,对感觉不对的部分提出异议,并细化你所寻找的内容。
质疑精美的输出。 当 AI 模型产出某些看起来不错的内容时,这正是暂停并追问的绝佳时机:这准确吗?有什么遗漏吗?这个推理站得住脚吗?正如我们上面讨论的,我们的数据显示,精美的产出伴随着更低的批判性评估率,即使用户在一开始花了更大力气来引导 Claude 的工作。
设定协作的条件。 仅在 30% 的对话中,用户告诉了 Claude 他们希望它如何与自己互动。试着明确地添加如下指令:"如果我的假设有误请反驳"、"在给我答案之前先带我理解你的推理过程",或者"告诉我你不确定的地方"。在对话开始时建立这些期望,可以改变后续整段对话的互动方式。
这项研究存在以下重要的注意事项:
样本局限性: 我们的样本反映的是 2026 年 1 月某一周内在 Claude.ai 上进行多轮对话的用户。由于我们认为这仍然是 AI 工具普及的相对早期阶段,这些用户可能偏向于已经熟悉 AI 的早期采用者——即可能不代表更广泛的人群。我们的样本应被理解为为这一人群提供基线,而非通用基准。由于数据来自单一周,它也无法捕捉任何季节性或纵向效应。而且由于聚焦于 Claude.ai,我们没有捕捉用户与其他 AI 平台的交互情况。
框架覆盖不完整: 在本研究中,我们仅评估了 24 种行为指标中可以在 Claude.ai 对话中直接观察到的 11 种。所有与负责任和合乎伦理地使用 AI 产出相关的行为都发生在这些对话之外,未被捕捉。
二元分类: 对于样本中的每段对话,我们将每种行为分类为"存在"或"不存在"。但这可能遗漏了重要的细微差别——比如存在争议或部分展现的行为,或者行为之间的重叠信号。
隐性行为: 用户可能在心理层面展现流利度行为(例如根据自身知识核查 Claude 的说法),而不在对话中表达这些行为。这对我们关于成品的数据似乎尤为相关——用户可能通过测试和实际使用来评估 Claude 的产出,而不是通过对话中可见的行为。
相关性发现: 我们识别出的关系是相关性的。我们不知道一种行为是否导致另一种行为,还是它们都反映了某些共同的潜在因素,如任务复杂度或用户偏好。
本研究为我们提供了一个基线,可用于评估 AI 流利度如何随时间变化。随着 AI 能力的演进和采用率的提升,我们致力于了解用户是否在发展更复杂的行为,哪些技能随经验自然涌现,以及哪些需要更有意识的培养。
在未来的工作中,我们计划在几个方向上扩展分析。首先,我们计划进行"队列分析",比较新用户和有经验的用户,以了解对 AI 的熟悉程度与流利度发展之间的相关性。其次,我们计划使用定性研究方法来评估在 Claude.ai 对话中无法直接观察到的行为。第三,我们旨在探索本研究引发的因果问题——例如,鼓励迭代对话是否会带来更多的批判性评估,或者是否有其他干预措施能更有效地促进这一点。
此外,我们希望探索 Claude Code 中的 AI 流利度行为,这是一个主要由软件开发者使用的平台。在为本研究做准备时,我们进行了一些初步分析,发现 Claude Code 对话与 Claude.ai 中的对话具有一致性。但这仍然是初步的,Claude Code 截然不同的用户群体和功能意味着需要更深入的研究。
我们预计 AI 流利度的本质将随着时间的推移而发生重大发展和演变。通过本研究及未来的研究,我们致力于让这种发展变得可见、可衡量、可行动。
如需引用本文,可使用以下 Bibtex 格式:
Kristen Swanson 设计了研究方案,主导了分析工作,并撰写了本报告。Zoe Ludwig 和 Drew Bent 参与了框架对齐、信息传达和审阅工作。4D AI 流利度框架由 Rick Dakan 和 Joe Feller 开发。Zack Lee 提供了技术支持。Hanah Ho 协助进行了数据可视化。Keir Bradwell、Rebecca Hiscott、Ryan Donegan 和 Sarah Pollack 提供了传播审阅和指导。