2026年,智能体产业呈现出一种鲜明的结构性反差:一边是技术、资本和企业投入持续升温,另一边是真正能够稳定进入生产环境的应用仍然有限。
今年5月,《智能体规范应用与创新发展实施意见》发布,明确提出推动智能体规范应用与创新发展。与此同时,AI应用活跃度持续攀升。国家数据局数据显示,2024年初我国日均词元(Token)调用量约为1000亿,到2026年3月已突破140万亿,两年增长超过千倍。
但应用热度并没有同步转化为规模化落地。Gartner调研显示,2026年CIO与技术高管调查,仅有17%的组织已完成AI智能体部署,超过60%的组织计划在未来两年开展部署。毕马威《2026全球技术报告》指出,88%的组织正在投资构建智能体AI系统,将其融入业务流程、产品与价值链,但仅有24%组织能够在多个业务用例上实现投资回报。
高热度与窄落地并存,正是当前智能体产业最值得观察的特征。
过去数月,我们对话了智能体产业链上的企业负责人和行业专家,覆盖通用模型、垂类智能体、企业认知系统、AI安全治理等核心环节,并深入医疗、金融、民生服务、办公等真实应用场景,形成《AI向实——智能体驱动产业变革》系列专题。
将不同受访者的实践和判断放在一起,一条产业逻辑逐渐清晰:智能体落地率不高,并不能简单归因于“模型还不够强”。当人工智能从生成答案进一步走向自主规划、调用工具和执行任务,产业面对的核心问题正在从“模型能力”转向“系统交付能力”。
规则明确的任务已经开始被智能体接管,但再向前一步,面对的将是大量没有被写成规则的行业经验、业务判断和决策分寸。如何将这些非标准化知识转化为机器可以理解、执行、验证和持续迭代的能力,可能才是智能体下一阶段真正的难题。
从“能聊”到“能干”,智能体热有了真实底座
这一轮智能体热潮不同于此前AI概念周期的一个重要原因,在于人工智能的能力边界正在发生变化。
传统对话式人工智能主要提供信息和内容,智能体则进一步形成“理解目标—拆解任务—调用工具—执行操作—反馈结果”的行动链路。人工智能的价值正在从“提供答案”走向“完成任务”。
与此同时,支撑智能体运行的基础设施也在不断成熟。推理成本持续下降,MCP(模型上下文协议)让智能体能够标准化地调用外部工具,A2A(智能体间通信协议)则让多个智能体之间可以协作完成任务,企业部署专属业务智能体的条件正在改善。
更重要的是,一批垂直场景已经开始产生可量化的业务价值。
在合同审核领域,达观数据的智能体实现人力缩减60%、处理时效提升80%;医疗保障领域,久远银海的智能体将医保特例单议审核周期从两周缩短至一天,申诉通过率超过90%;保险理赔领域,商汤科技相关智能体已服务千万级用户。
这些率先跑通的场景呈现出高度一致的特征:规则相对明确、流程可拆解、结果可衡量,同时风险和容错范围相对可控。
久远银海AI首席技术官吴钒在本专题访谈中总结:“规则相对明确、低风险、高容错的服务场景,最容易率先实现规模化应用。”
原因并不复杂。标准化场景已经提前完成了一次“知识工程化”过程——规则被明确表达,流程被拆分,判断标准得到固化,智能体主要承担理解和执行。
真正困难的,是大量依赖隐性经验的非标准化任务。当规则没有被写下来、结果又缺少天然的验证机制时,模型从“知道怎么做”到“稳定把事情做成”,中间仍存在明显的工程鸿沟。
从模型能力到系统交付,还要跨过四道门槛
智能体与问答式人工智能的另一重区别,在于任务不再是一次生成,而往往需要连续执行多个步骤。
假设每一步正确率都达到99%,连续执行50步后,整条链路一次性全部正确的概率也只有约六成。任务越长,错误越容易累积,更棘手的是,系统往往无法及时判断究竟在哪一步出现了偏差。
因此,生产级智能体真正需要解决的,不只是“能不能做”,而是能否观察状态、验证结果、发现错误、重新执行,并在必要时触发人工接管。
从本次系列采访来看,智能体距离规模化交付至少还需要跨过四道门槛。
第一道,是可靠性工程与验证闭环。
多步任务不能依赖模型“一次做对”。系统需要具备可观测、可验证、可回滚和可接管能力,在任务执行过程中持续获得反馈,并根据结果重新规划。
香港中文大学(深圳)助理教授王本友将其概括为“闭环工程”。在他看来,大模型决定能力上限,而运行环境影响智能体可靠性的下限。
澳门大学教授黄辉则进一步把“可验证性”视为规模化落地的重要前提。真正可靠的纠错不能只依赖模型自我反思,还需要测试、规则校验、业务状态和人工反馈等外部机制。
这也是为什么编程智能体能够较早进入复杂任务场景:代码有编译器和测试用例充当“裁判”。而医疗、治理、管理决策等结果难以即时判断的领域,要构建同等强度的验证机制显然困难得多。
第二道,组织认知工程化
如果说验证闭环解决的是“如何稳定执行”,那么组织知识工程化解决的则是“依据什么判断”。
大量企业拥有数据,却未必拥有能够直接被AI调用的业务知识体系。行业经验散落在人脑、部门协作和历史流程中,很多关键判断依赖经验、偏好与分寸,而不是已经编码的规则。
这意味着,智能体部署之前,企业往往还需要完成数据治理、流程梳理、权限分级、业务规则显性化和知识结构化等基础工作。
如果流程本身没有标准,数据没有打通,责任边界也不清晰,智能体不仅无法自动修复组织问题,还可能将原有流程中的不确定性进一步放大。
第三道,是单位经济性。
智能体往往需要更长上下文、多轮推理和频繁工具调用。企业真正需要计算的,不只是词元(Token)价格,而是每个成功任务的总成本,包括模型调用、人工复核、错误修正和系统维护成本。
好的一面是,推理成本仍在快速下降,商业模式也开始从按词元(Token)计费向按席位、工作量乃至业务结果付费演变。相比其他瓶颈,经济性可能随着技术进步较快改善。
第四道,是安全治理与责任边界。
当AI从“提供答案”转向“执行操作”,错误带来的风险也从信息偏差进一步转化为越权操作、经济损失甚至现实安全问题。
因此,在高风险、低容错场景中,“人在回路”仍然是现阶段的重要原则;而在规则清晰、结果可验证的场景中,智能体的自主执行范围则可以逐步扩大。
四道门槛的解决周期并不相同。
经济性可以伴随技术进步逐步改善,安全与责任边界需要技术、监管和制度共同演进,闭环工程则依赖模型能力和企业系统建设同步推进。
相比之下,组织认知工程化可能是一场更长期的竞争。
因为将散落在人脑、部门和业务流程中的经验、规则和判断边界,转化为机器可以理解、执行和迭代的能力,既无法完全依靠外部供应商代劳,也很难通过一次模型升级完成。
当模型趋于通用,竞争转向“场景资产”
当高性能基础模型的可获得性不断提高,企业AI竞争的稀缺要素也在发生变化。
过去的问题是“有没有足够强的模型”,下一阶段的问题越来越接近:能不能在非标业务场景中,把模型转化为企业自己的生产能力。
在本次系列采访中,不同受访者使用了不同概念描述这一变化。
有人称之为“场景资产”,有人强调“认知资产”,也有人将重点放在行业知识、评测体系和数据闭环。表述不同,但核心逻辑相近:真正难以复制的,不是某一个可以采购或替换的模型,而是企业长期业务实践中积累形成的任务环境、工具体系、行业知识、业务规则、评测标准和反馈数据。
东方国信佟佳睿在采访中表示:“模型只是基础,仅占企业AI落地这件事的1/8,剩下的7/8是组织落地和认知落地——能不能把分散在部门、流程、人脑里的判断沉淀下来,能不能持续进化。”
这也是垂直智能体价值进一步凸显的原因。
通用大模型能够提供越来越强的语言理解、知识调用和推理能力,但真正进入企业核心流程,仍需要与具体的数据、系统、权限、工具和行业know-how结合。
模型能力越来越容易获得,但对业务的理解很难直接采购。
至少从本次采访涉及的一线场景来看,当前智能体更多是在重构岗位内部的任务分配,而不是直接完成整个岗位替代。一部分高频、重复、结果可验证的执行工作开始被AI接管,人则更多承担目标设定、策略判断、异常处理和结果复核。
在大量非标准化经验被充分工程化之前,人的判断仍然是智能体运行体系中的重要一环。
结语:从能力竞赛走向交付竞赛
有受访学者将AGI(通用人工智能)的演进路径概括为,它不会一次性、均匀地降临,而更可能首先在边界清晰、工具完备、结果可验证的场景中,以“局部AGI”的方式出现。
沿着这一逻辑理解今天的智能体产业,“窄落地”并不意味着发展停滞,反而可能是产业从技术演示走向规模化应用必须经历的阶段。
智能体不会同时进入所有行业、接管所有任务,而更可能从规则清晰、反馈及时、价值容易衡量的环节开始,逐步向需要更多上下文、组织知识和复杂判断的业务流程延伸。
企业也将在这一过程中重新审视自身的数据、流程和知识体系,将过去依赖个人经验和组织惯性的部分逐步表达、验证和沉淀,转化为AI可以调用的生产能力。
当基础模型逐渐成为通用能力,产业竞争的重点也将从“模型能力竞争”进一步转向“系统交付竞争”:工程体系决定AI能否稳定运行,业务理解决定AI能否创造价值,而长期积累的场景资产,则可能决定这种价值能否形成持续壁垒。
对于企业而言,需要回答的问题正在从“模型够不够强”,变成“哪些任务值得交给AI,以及如何让AI持续、可靠地把它们做好”。
智能体产业最终要验证的,不只是技术还能做到什么,而是能否把不断提升的模型能力,转化为可验证、可复制、可持续交付的业务价值。
红星新闻记者 李伟铭