Agent 上生产线:一半公司已跨过,卡在哪

2026-09-24 Aryee 4

关于企业 Agent 落地,2026 年最不缺的就是数字,最缺的是「这个数字量的是什么」。我先把能查到原始定义和样本的几个列出来,再谈卡点——顺序反了容易被带偏。

有据可查的几个数

57% 的公司已经有 Agent 在生产线跑。 LangChain 的《State of Agent Engineering》,2026-06-12 发布,调查窗口是 2025 年 11 到 12 月,样本 1340 名从业者。同一份里还有:质量与可靠性是被提到最多的障碍;89% 的团队在用可观测性工具,只有 52% 在跑评测。

这组数字里最值得记的是最后一条的落差:看链路的人比做评测的人多得多。看得到 Agent 干了什么,不等于能判断它干得对不对。

「95% 的企业 AI 试点失败」——不建议引用。 这个说法出自 MIT NANDA 2025 年 7 月的一份报告,被引得很广。原始材料是 300 多个项目的梳理加 52 次访谈,并没有一个稳定的分母,它不是一份「统计了 285 个失败案例」的清单。当作定性参考可以,当作失败率不行。

「40% 以上的 Agentic AI 项目会在 2027 年底前被取消」——注意这是预测。 Gartner 2025 年 6 月的新闻稿,是前瞻性判断,不是已经观测到的取消率。另外 Gartner 2025 年 2 月那份 60% 的弃用预测,适用范围限定在「缺乏 AI-ready 数据」的项目上,脱离这个前提引用会失真。

42% 的组织在上线前停掉了大多数 AI 概念验证。 S&P Global 2025 年 5 月,有效样本 878(总量 1006)。这是这堆数字里少数直接问「你们停没停」的。

约 6% 是「高绩效者」。 McKinsey 2025 年 11 月,n=1993,定义严格:要能把收益算到 5% 以上的 EBIT 上才算。所以「80% 说提效、只有 6% 赚到钱」这类标题,两个数用的是完全不同的尺子。

从这些数里能得出的判断

把上面几条并排看,2026 年的实际情况是:上线不是稀缺事件,稳定运行才是。 一半以上公司有 Agent 在跑,但只有半数左右做了评测。也就是说,大量在生产线的 Agent,其质量结论来自人工抽查和告警,不来自可重复的判断。

三类真实卡点

一、可靠性:不是模型不稳定,是链条太长

一次 Agent 调用可能包含:规划、若干次工具调用、若干次重试、最终汇总。这里不引外部数字,只按一个假设算:单步 95% 的成功率,串十步只剩 0.95¹⁰ ≈ 60%,串二十步剩 36%——链条长度本身就是可靠性指标。工程上能做的不是「挑更准的模型」,而是把链条缩短:能用一次函数调用解决的,不要让模型规划五步。

我在实践里的取舍是,把流程切成两段——模型只做需要判断的那一步,其余用确定代码写死。多数所谓 Agent 需求,真正需要模型参与的只有一两个节点。

二、验证:看得到链路,判不了对错

89% 用可观测、52% 做评测,这个落差就是卡点本身。补起来不需要多重的工具,最少三件东西:

  1. 一组固定的评测样本,来源是线上真实输入,几百条起步。
  2. 一个能自动执行的判定标准——格式校验、字段抽取比对、或者规则断言都行,别一开始就追求「让另一个模型来评」。
  3. 上线门槛:换模型或改提示词必须跑完这一组,跑不过就不放流量。

第 3 条是真正的分水岭。前两条多数团队做得到,第三条做不到是因为没人愿意让评测挡住发布节奏。

三、权限:Agent 拿到的是谁的凭据

这是我认为最被低估的一条。Agent 要调工具,工具要访问系统,那它用哪个身份?常见的三种答案都不对:

做法 问题
复用运维账号的凭据 权限远大于任务所需,且审计里分不清人和 Agent
用调用用户的凭据 用户不在线时任务跑不完,长任务无法续期
全局服务账号 所有 Agent 共享一个身份,出了事故无法定位到具体调用方

能落地的做法是给 Agent 单独发身份,权限按工具维度授予、按任务作用域收窄,并且默认只读——写操作要么走人工确认,要么限制在明确圈定的资源范围内。这一套在 API 网关时代就有成熟做法,只是过去没用在非人主体上。

一件现在就能做的事

如果只做一件事,我会选:给当前跑在线上的 Agent 加一个最小评测集。

不需要平台,一个能重复执行的脚本加一份样本文件就够。价值在于它把「最近感觉有点不对」变成「上周通过率 91%,这周 78%」。有了这个尺子,前面说的可靠性优化和权限收紧才知道有没有效果——否则所有改进都只是换了个说法。

你手上那套系统,卡在哪一步?

留个手机号和方便的时间,我打过来先听你说现状与约束,再给可执行的判断:这套系统是该继续修、该动哪里,还是干脆重做一版设计更省。

约一次沟通不接纯 UI 外包,只做系统层面的问题。