AI 项目失败率到底是多少:六个流传数字的溯源核查

产业洞察数据治理AI 落地数字核查决策方法

公开流传的「AI 项目失败率」有六个被反复引用的数字,跨度从 40% 到 95%。逐一追溯原始出处后,其中只有一个来自对企业的实际测量:两个是分析机构对未来的预测,两个发布于 2016 至 2020 年之间且至今无人重新测量,还有一个的方法学正在被公开要求撤稿。

这六个数字目前出现在采购论证、立项报告、行业白皮书和董事会材料里,被当作同一类东西使用。它们不是同一类东西。

六个数字的出处、年份与性质

数字 发布方 时间 样本 性质
60% 的 AI 项目将因缺乏 AI-ready 数据被放弃 Gartner 2025-02 2024 年三季度调研 248 位数据管理负责人 预测
42% 企业放弃了大部分 AI 计划 S&P Global Market Intelligence 2025-03 n=1006,北美与欧洲 实测
95% 的 GenAI 试点无可测业务回报 MIT NANDA 2025-07 52 场高管访谈、153 份问卷、300 余份公开部署记录 一手,方法学受质疑
40% 以上 agentic AI 项目将在 2027 年底前取消 Gartner 2025-06 一场 webinar 的 3412 名参会者投票 预测,非随机抽样
每年因劣质数据损失 1290 万美元 Gartner 2020 未公开 六年前的数据
60% 至 73% 的企业数据从未用于分析 Forrester 2016–2017 未公开 近十年前,确切年份不详

把这张表按「性质」而不是按「数值」重新排列,分布是这样的:

图 1 六个流传数字的性质分布。唯一实测的一个用绿色标出。
图 1 六个流传数字的性质分布。唯一实测的一个用绿色标出。

数值的差异(40% 到 95%)看起来像是不同研究得出的不同结论,实际上大部分差异来自这些数字根本不在回答同一个问题。有的在预测未来两年,有的在统计已经发生的放弃行为,有的在衡量利润表上有没有体现。

「95% 的 AI 项目失败」这个数字是怎么来的

这是六个里传播最广的一个,也是偏移最大的一个。

原始报告是 MIT NANDA 项目 2025 年 7 月发布的 The GenAI Divide。报告的原话是 95% 的生成式 AI 试点没有可测量的业务回报(no measurable P&L impact)。传播过程中,它变成了「95% 的企业 AI 项目失败」。

这两句话不是一回事。一个项目可以完全按预期运行、用户满意、流程跑通,同时在财务报表上留不下可归因的痕迹——因为收益分散在多个部门、因为观察窗口太短、因为企业本来就没有建立归因口径。把「测不出利润贡献」等同于「失败」,等于假设所有价值都必须在报告期内落到 EBIT 上。

图 2 「95%」从研究结论到传播口径的偏移。
图 2 「95%」从研究结论到传播口径的偏移。

这份报告受到的质疑集中在三点:样本自选、ROI 观察窗口过短、以及发布方的立场——该报告出自一个从事 agentic 基础设施研究的项目,而它的结论恰好是企业需要 agentic 基础设施。沃顿商学院的 Kevin Werbach 公开要求 MIT 要么公布支撑数据、要么撤回该报告。截至 2026 年 9 月,报告仍挂在 NANDA 的代码仓库上,未撤回,支撑数据也未公布。

需要说清楚的是:质疑方法学不等于断定结论错误。95% 这个数字可能是对的。但在支撑数据公开之前,它只能作为「一份有争议的观察」被引用,不能作为事实被引用。这两种引用方式在一份采购论证里的分量完全不同。

Gartner 的两个数字是预测,不是统计

「60% 的 AI 项目将因缺乏 AI-ready 数据被放弃」和「40% 以上的 agentic AI 项目将在 2027 年底前被取消」,这两句话的语法时态已经说明了性质——它们是对未来的预测。

预测有其价值,分析机构的预测尤其能反映行业共识的走向。问题出在引用环节:这两句话在二次传播中普遍丢掉了「将」字,变成了「60% 的 AI 项目因为数据问题失败了」。一个尚未发生的判断被改写成了已经发生的统计。

第二个数字还有一层需要注意。它的样本是 2025 年 1 月一场 webinar 的 3412 名参会者投票。会主动参加 agentic AI 主题 webinar 的人,本身就是对这个议题有强烈兴趣或强烈焦虑的群体,不构成随机抽样。3412 这个数字看起来很大,但样本量大不能修正样本偏差。

唯一的实测数字说了什么

S&P Global Market Intelligence 的 Voice of the Enterprise: AI & Machine Learning 是这六个里唯一一个对企业实际行为做测量的:n=1006,覆盖北美与欧洲,2025 年 3 月发布。

它的结论是:42% 的企业放弃了大部分 AI 计划,而一年前这个比例是 17%。同时,平均 46% 的概念验证没有进入生产。

值得注意的不是 42% 这个绝对值,而是 17% 到 42% 这个变化。它测量的是同一批问题在两个时间点上的答案,因此变化趋势比单点数值更可靠。这也是六个数字里唯一一个能支撑「情况正在恶化」这类判断的。

有意思的是,这个唯一的实测数字,恰恰是传播度最低的一个。

两个仍在流通的老数字

「每年因劣质数据损失 1290 万美元」出自 Gartner,发布于 2020 年。「60% 至 73% 的企业数据从未用于分析」出自 Forrester,发布于 2016 至 2017 年前后

这两个数字今天仍然大量出现在 2026 年发表的文章、方案和白皮书里,通常不标注原始年份。

它们未必是错的。问题在于,从 2016 年到 2026 年,企业的数据基础设施、存储成本、分析工具的可及性都发生了结构性变化。一个在云数仓普及之前测出的「数据未被使用比例」,是否还能描述今天的状况,需要重新测量才能回答——而这十年间,没有人重新测量过。

反方:老数据不等于错数据

对上述整理,最有力的反驳是:数据陈旧不等于数据错误。物理常数不会因为测量年份久远而失效,某些结构性的行业规律同样可能长期稳定。要求每个数字都在最近两年内重新测量,是一种不切实际的洁癖,而且会让本来就稀缺的行业量化研究更加无法使用。

这个反驳成立,而且必须接受。本文的论点不是「这些数字错了」——判定对错需要重新测量,而重新测量恰恰是没人做过的事。

论点是更窄的一条:这些数字从未被重新验证过,却在被当作当前事实使用。

两者的区别落在实际操作上,就是引用方式的区别。写「Forrester 在 2016 年前后的测量显示,60% 至 73% 的企业数据未用于分析;此后未见同口径的重新测量」,和写「超过六成的企业数据是沉睡的」,前者是可核查的陈述,后者是无法反驳也无法验证的断言。工作量的差别只有一句话,可信度的差别是整篇材料的成色。

引用一个数字前该问的五个问题

图 3 引用一个数字前的五项核验。
图 3 引用一个数字前的五项核验。

这五个问题构成一道最低限度的过滤。任何一项答不上来,这个数字就不应该进入正式材料。

出处。 原始发布方是谁,链接在哪里。二手转述必须能追到一手。如果所有检索结果都指向另一篇同样没给出处的文章,这个数字就是无源的。

年份。 原始发布时间,不是引用它的那篇文章的发布时间。被引用了十年的数字要标注原始年份,让读者自己判断时效。

样本。 多少人、什么行业、什么地区、怎么抽的样。样本量大不代表样本好——3412 人的自选样本不如 1006 人的抽样样本。

性质。 这是实测、预测,还是自选调研。三者在论证中的分量完全不同,混用是最常见的失信方式。

谁出的钱。 发布方与结论之间有没有利益关系。厂商发布的数据不是不能用,但必须标注立场:一份由语义层厂商发布的、结论是「企业需要语义层」的研究,其数据可以引用,其结论需要独立验证。

一个可以立刻执行的动作

把过去一年里本组织对外发布的材料——方案、白皮书、汇报——中引用的行业数字整理成一张表,逐条填上这五列。

通常的结果是,其中相当一部分填不满。填不满的那些,要么补上出处,要么删掉。

这件事的成本是几个小时,收益是:当客户或评委追问某个数字的来源时,有答案。在一个大量材料都答不上来的环境里,答得上来本身就是差异。