核心结论

人和 Agent 长期共事,改变的是二者之间的接口,而不是一个工具清单。这个接口必须被当成一份契约来设计,明确写清四个条款:谁发起、谁校验、谁兜底、上下文如何传递。微软 2026 工作趋势指数把人与 Agent 的协作拆成四种模式,作者(人产出、按需调 Agent)、编辑(人给意图、Agent 出草稿、人审)、导演(人写规格、Agent 后台自治跑)、统筹(人搭系统、多 Agent 并行、异常升级给人),可一一对应为角色级的四种契约原型。失败几乎都发生在契约层面:校验角色塌掉(微软与 CMU 的 CHI 2025 实验显示约 40% 的 AI 辅助任务没有经过批判性思考)、契约在无人重签的情况下从作者悄悄滑向统筹、上下文在交接中丢失、兜底责任在多 Agent 间弥散。CHI 2026 的人智协作研究把问责、共同立场、不确定性信号、相互依赖列为必须显式设计的接口要素。多数 Agent 落地失败是契约未被设计、未被签署,而不是模型能力不足。契约设计归 HR 与组织设计,不归 IT 采购。

关键数据

  • Microsoft《2026 工作趋势指数:Agents, Human Agency, and the Opportunity for Every Organization》(2026):基于 10 个市场、2 万名 AI 使用者调研,以及对数万亿条匿名化 Microsoft 365 生产力信号的分析。提出人与 Agent 的四种协作模式:Author(作者)、Editor(编辑)、Director(导演)、Orchestrator(统筹);Microsoft 365 中活跃 agent 数量同比增长 15 倍,大型企业增长 18 倍;组织因素占 AI 实际影响的 67%,约为个体心态(32%)的两倍。该报告把四种模式作为领导者为工作流匹配协作形态的操作框架,是契约原型设计的事实底座。
  • Yao、Chen、Chen、Wang、Li、Wang(CHI 2026,《Through the Lens of Human-Human Collaboration》):DOI 10.1145/3772318.3790879。主张将 LLM agent 视为远程人类协作者来设计接口,明确点名有效协作所需的四项社会技术要素:共同立场(common ground)、不确定性信号(signaling uncertainty)、问责(accountability)、相互依赖(interdependence);指出缺少这些要素会削弱信任、损害人类能动性、在高风险场景下破坏可靠依赖。这是 2026 年人智协作接口设计的直接一手文献。
  • Lee、Yin、Jia 等(Microsoft Research 与 CMU,CHI 2025,《The Impact of Generative AI on Critical Thinking》):对 319 名每周至少使用一次生成式 AI 的知识工作者调研,收集 936 个真实工作案例。结果发现约 40% 的 AI 辅助任务没有触发批判性思考,对 AI 能力的信心越强,投入批判性思考的意愿越低。这是 2025 年研究,作为 2026 年人智契约讨论里校验角色失效的方法论底座被反复引用。
  • Microsoft Research CHI 2026 精选六篇论文(2026):其中对 19 名专业编剧为期两周的人机共创追踪研究,基于班杜拉人类能动性理论识别意向性、前瞻性、自我调节、自我反思四个维度;一项 21 天田野研究以 96 名 18 至 26 岁参与者评估跨时间情感建模伴侣智能体 Auri,验证长期连贯交互对能动性感知的影响。两研究共同指向一点:人把 Agent 当伙伴时,能动性与主体性是必须被主动保护的对象。
  • Harvard、MIT、Stanford、Oxford 联合团队系统综述(arXiv:2501.12557,2025):对 2020 至 2024 年 CHI 会议 153 篇涉及 LLM 的论文做系统综述,发现 LLM 工作覆盖 10 个领域,作者普遍提出有效性与可复现性担忧,且绝大多数研究使用闭源模型,社区缺乏使用 LLM 的明确指南与最佳实践。这提醒契约设计不能建立在黑箱假设上,接口要对来源与路径保持可审计。

"真正的约束,已不再是'人能做什么',而是'工作如何围绕人来组织'。"

微软《2026 工作趋势指数》

关于 Agent,最流行的一个误判是把它当成更强力的工具。工具的逻辑是买进来、配好、用起来,能力在工具里,人在外面操作。但当一个非人行动者开始持续参与决策、起草、执行,并能在后台自治跑一段,它和人之间就不再是操作与被操作的关系,而是一个需要被定义的协作关系。这个关系如果不写下来,就会被默认的省力逻辑悄悄填满。

组织设计者老早就知道,岗位的边界是用角色说明书定义的:谁负责、谁拍板、向谁汇报。Agent 进入角色之后,这套定义出现了一块空白。Agent 不是员工,没有岗位说明书,也不在汇报线上。但它实实在在地发起动作、产出结果、做出判断。这块空白不补,出的事往往不是 Agent 太笨,而是人和 Agent 都以为对方在负责。

一、Agent 不是工具,是一个需要签契约的行动者

CHI 2026 的一篇人智协作研究把 LLM agent 直接类比为远程人类协作者,理由是二者都靠结构化通道(文本、语音)沟通,都缺少面对面交互里的社交线索(表情、语气),也都依赖共同立场、透明信息和相互依赖来建立信任。这个类比的用处不在修辞,在接口:既然把它当协作者,就要像对待远程同事一样,把问责、共同立场、不确定性信号、相互依赖这四件事显式设计出来,而不是假设它们会自动发生。

遗憾的是,多数组织把 Agent 当工具接入时,跳过了这一步。结果就是一批"契约失败"而非"模型失败"的案例:Agent 在没人授权的情况下越界做了决定,或者卡在一个没人兜底的状态里停摆,或者产出看似合理、出了问题却找不到谁该负责。这些不是能力问题,是接口没写清。

把视角锁在 HR 与组织设计上,结论很直接:Agent 带来的不是一次采购,而是一次岗位边界重写。重写的内容就是人和 Agent 之间的契约。

二、契约的四个必写条款

一份角色级的人智契约,至少有四个条款必须写清。少一条,接口就留有模糊地带,而模糊地带在压力下一定会被默认成最省力的那种。

谁发起。任务由谁提出、谁定义目标与边界。是人给一句话,还是人写一份规格,还是人只搭一个系统让 Agent 自己找事做。发起权决定了 Agent 的自主半径。

谁校验。产出由谁确认质量与正确性。这是最容易被塌掉的一栏。校验可以是逐件审,也可以是抽样审,但必须有人名字对应,不能是"系统自己觉得没问题"。

谁兜底。出了偏差、异常、冲突,谁接手。兜底不等于背锅,而是定义升级路径:Agent 跑到哪一步必须停下来交回人,人在哪一层保留最终否决权。

上下文怎么传。任务交接时,意图、依据、历史、约束条件如何被携带和复现。上下文丢失发生在交接处,不在单次对话里,这是后面要专门拆的一点。

这四个条款组合起来,就是一份角色说明书的 Agent 版本。它不必写在纸上,但必须在运行中被显式定义、被双方(人和系统设计者)认可。隐性的契约不是没有契约,是有一份没人读过的契约在替你做决定。

三、四种契约原型,以及它们各自怎么烂

微软 2026 工作趋势指数把人与 Agent 的协作拆成四种模式。我们把它重述为四种契约原型,每种对应一组不同的发起、校验、兜底与上下文条款。重点不在模式本身,在每种模式特有的失败信号。

作者契约:人产出,按需调 Agent

人自己做主要产出,只在需要时调 Agent 帮一个小忙:一行代码、一张图、一段查证。契约条款是发起=人、校验=人、兜底=人,Agent 没有发起权,半径最小。

失败信号:人开始把"调一下"说成"你全做了",发起权在没人重签契约的情况下滑给 Agent,契约悄悄从作者变成编辑。最危险的是这种滑动无声无息,因为没有一道关卡会拦下"顺手多交一点"。组织要设的红线是:一旦 Agent 开始主动定义任务范围,作者契约就已失效,必须重签。

编辑契约:人给意图,Agent 出草稿,人审

人陈述意图,Agent 生成初稿,人编辑并确认。发起=人(意图),起草=Agent,校验=人,兜底=人。这是当前最常见的形态,也是校验角色最容易被掏空的形态。

失败信号:人的"编辑"退化为"通过"。微软与 CMU 在 CHI 2025 的实验里发现,约 40% 的 AI 辅助任务没有经过批判性思考,对 AI 能力的信心越强,人越不质疑。当编辑不再编辑,契约就失败了,而失败通常无声无息。给校验留出不可跳过的节点,是编辑契约能成立的前提。

导演契约:人写规格,Agent 后台自治跑

人写一份规格说明,把整段任务交给 Agent 在后台执行,回来给结果。发起=人(规格),执行=Agent 自治,校验=部分,兜底=人(异常升级)。

失败信号:Agent 跑偏一长段才被人发现,且路径无法还原。导演契约的命门是校验不能落在每件产物上(否则就和编辑契约没区别),所以必须配任务隔离、回滚和审计轨迹。没有这些,Agent 在后台做的每一步都不可见,兜底的人接到异常时已经来不及。CHI 2026 强调的不确定性信号,在这里就是 Agent 该在拿不准时主动停下来,而不是硬跑。

统筹契约:人搭系统,多 Agent 并行,异常升级给人

人设计一套系统,多个 Agent 在工作流里并行运转,把异常和需升级的事项交回人。发起=人(系统),执行=多 Agent,校验=Agent 间部分互校,兜底=人(跨 Agent 异常)。

失败信号有两种。一是上下文在 Agent 间交接时丢失,人收到的异常无法回溯,只能重来。二是问责弥散:三个 Agent 各做一段,出了错没人能说清哪一段的责任,人成了名义上的兜底却实际无法追责。统筹契约要求最强的接口纪律,因为它把单点契约扩展成了网络契约,任何一处上下文断裂都会沿网络放大。

四、校验角色为什么会塌

四种原型里,校验都是人的保留项,也都最容易塌。原因不是人懒惰,是经济学:当 Agent 给出"够用"的答案,实质校验的边际成本显得不划算,形式通过的成本几乎为零。人会理性地选择后者。

CHI 2025 那项 319 人实验还点出一个更深的机制,可以叫自动化的反讽:把常规任务机械化、把异常处理留给人,会剥夺人练习判断的日常机会,等到异常真的来了,人已经肌肉萎缩、准备不足。这意味着,校验塌掉不是一次性的疏忽,而是长期把判断外包之后能力的慢性流失。组织在接口设计上必须对抗这个趋势,办法不是训话,而是把校验节点固化进流程,让判断的日常练习不被省掉。

一个可操作的做法:在编辑和导演契约里,规定关键产出必须附可审计的来源与推理链。人审的不是"看起来对不对",而是"来路能不能讲清"。这把校验从主观感觉变成可验证动作,也顺带解决了上下文传递的问题。

五、兜底与追责:导演和统筹契约的硬骨头

兜底始终在人,这一点没有争议。有争议的是兜底怎么落地。导演契约里,人兜底的是异常升级,前提是 Agent 跑的过程中有 checkpoint、有回滚、有轨迹。统筹契约里,人兜底的是跨 Agent 的冲突与升级项,前提是上下文在 Agent 间交接时不被截断。

CHI 2026 的研究把问责(accountability)和共同立场(common ground)列为协作的核心要素,放到兜底语境里就是两句话:出事的环节要能定位到Agent,升级给人时要带得齐上下文。做不到这两点,兜底就是一句空话,组织只能事后追责到"用 AI 的人",而真正的问题在接口。

追责弥散是统筹契约特有的风险。多 Agent 并行时,单一结果由多段贡献合成,任何一段的偏差都难归因。这要求系统设计者在一开始就把"可归因"写进契约,而不是等出事再倒查。可归因不是技术细节,是组织治理的底线。

六、上下文怎么传,才不会丢

上下文丢失是静默的,也是最多的。人把任务交给 Agent,Agent 把半成品交给下一个 Agent,最后把异常交回人,每一处交接都是丢上下文的关口。单次对话里上下文很齐全,一交接就散。

解决思路是把上下文当成产物来管理,而不是当成某个人脑子里的东西。微软研究院 CHI 2026 的 AskEase 系统靠管理三类上下文来推断用户意图:环境上下文(屏幕状态、实时轨迹)、知识上下文(检索到的依据)、对话上下文(历史与当前卡点)。这套分法值得借到组织接口设计:人交给 Agent 的不能只是一句指令,而是带齐这三类上下文的包裹;Agent 之间交接、交回人,也都传递这个包裹。上下文一旦可携带、可审计,校验和兜底才站得住。

这反过来也限制了契约的复杂度。一个交接三次以上的长流程,如果每次交接都不补上下文,到人手里的异常就是黑箱。组织要为每个交接点设上下文清单,清单缺失则流程不能往下走。这是接口纪律,不是技术偏好。

七、契约设计归谁:这是组织设计,不是 IT 采购

回到约束在哪。微软 2026 工作趋势指数给的数字是,组织因素占 AI 实际影响的 67%,约为个体心态的两倍。换句话说,Agent 能不能用好,瓶颈在系统不在个人。契约设计因此天然落在 HR 与组织设计手里,不落在 IT 采购单上。

具体四件事,现在就该接手。

第一,把契约写进岗位说明书。明确谁发起、谁校验、谁兜底是可评价的问责项,而不是工具清单里一条"熟练使用 AI"。没有写进说明书的契约,运行中被默认成最省力形态的概率接近百分之百。

第二,为高自治契约配置审计轨迹与升级路径。导演和统筹契约若没有 checkpoint、回滚、可归因,就不应上线。这是治理门槛,不是效率成本。

第三,训练前沿使用者那种把模型输出当草稿、暂停分配人机工作的习惯。微软研究中表现最好的前沿专业使用者,特征正是会刻意分配人与 Agent 的分工、主动不带 AI 练习技能、把模型输出当素材。这种习惯能被设计出来,也能被培训出来。

第四,把契约是否被遵守设为可度量的治理指标,而不是只看 Agent 用了多少。一个该问的体检问题很简单:过去一个季度,我们哪条工作流重签了人智契约,哪条还在用一份没人读过的隐性契约运行。如果答不上来,说明 Agent 在跑,契约还在睡。

人和 Agent 之间那层接口,不会因为它看不见就不存在。它每天都在被默认填充,填充的方式取决于谁先动手设计。等出事再补,补的是事故报告,不是契约。把契约当成组织设计来写,是这一轮 Agent 落地里最被低估、也最决定成败的一件事。

参考信源

  • 【10 个市场、2 万名 AI 使用者调研,数万亿条匿名化 M365 信号;四种协作模式 Author/Editor/Director/Orchestrator;M365 活跃 agent 同比增长 15 倍(大型企业 18 倍);组织因素占 AI 影响 67%(个体心态 32%);49% Copilot 对话用于认知工作;约束从"人能做什么"转向"工作如何围绕人组织"】:Microsoft,《2026 Work Trend Index: Agents, Human Agency, and the Opportunity for Every Organization》,2026。
  • 【将 LLM agent 视为远程人类协作者设计接口;四项社会技术要素:共同立场、不确定性信号、问责、相互依赖;缺位会削弱信任、损害人类能动性、破坏高风险场景下的可靠依赖】:Yao B., Chen J., Chen C., Wang A., Li T. J., Wang D.,《Through the Lens of Human-Human Collaboration: A Configurable Research Platform for Exploring Human-Agent Collaboration》,Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems(CHI '26),Barcelona,2026,DOI 10.1145/3772318.3790879。
  • 【319 名每周至少使用生成式 AI 的知识工作者、936 个真实工作案例;约 40% 的 AI 辅助任务未触发批判性思考;对 AI 信心越强、批判性思考意愿越低;自动化的反讽:常规任务机械化、异常留给人,会剥夺人练习判断的机会】:Lee M., Yin M., Jia N. 等,Microsoft Research 与卡内基梅隆大学(CMU),《The Impact of Generative AI on Critical Thinking》,CHI 2025。
  • 【CHI 2026 六篇论文精选;19 名专业编剧两周人机共创追踪,班杜拉人类能动性四维度(意向性/前瞻性/自我调节/自我反思);96 名 18 至 26 岁参与者 21 天田野研究评估跨时间情感建模伴侣智能体 Auri】:Microsoft Research,《科研上新:从工具到伙伴,人机协作迈入深度共融时代》,2026。
  • 【2020 至 2024 年 CHI 会议 153 篇涉及 LLM 论文系统综述;覆盖 10 个领域;作者普遍提出有效性与可复现性担忧;绝大多数研究使用闭源模型,缺乏明确指南与最佳实践】:Pang R. Y. 等,Harvard、MIT、Stanford、Oxford 联合团队,《Understanding the LLM-ification of CHI》,arXiv:2501.12557,2025。