要衡量一个 AI agent 的 ROI,先在上线前立好基线——这件事今天在时间、金钱、出错率上到底花你多少——再用(获得的价值 − 全部运行成本)去对照它。成本要算全:订阅费、token、搭建时间,还有人工复核的时间。绝大多数项目跳过了基线这一步,所以它们大多也没算清。
为什么大多数 AI agent 的 ROI 数字经不起推敲
先看一个数字:在 IBM 2025 CEO 调研(覆盖 33 个国家、2000 位 CEO)中,只有 25% 的 AI 项目达到了预期 ROI,真正把 AI 铺到全企业的只有 16%。麦肯锡 State of AI 2025 从财务侧讲的是同一个故事:多数企业都在用 AI,但真正靠它拿到 5% 以上 EBIT 影响的高绩效者只有约 6%。差距不在模型。麦肯锡与真实利润影响相关性最强的一个因素,是彻底重做工作流程——是那些重新设计了活儿怎么干的公司,而不是把 agent 硬塞进旧流程的公司。
所以在你算任何东西之前,先认清对手。一个写着"agent 处理了 4000 个任务"的看板不是 ROI,那是活动量。ROI 是(价值 − 成本),对照的是这件事在 agent 出现之前花你多少。这就是我们对每一个 agent 说法都用的炒作 vs 现实那把尺子:一个 demo 在被拿去和基线比之前,什么都不算。下面用三步拿到一个诚实的数字。
第一步——上线前先立基线
你没法拿回报去比一个你从没写下来的数。在 agent 真正跑任何东西之前,花一周把这件事今天的样子量清楚:每次要花多久、花多少钱、多久出一次错。 Blue Prism 也是这么框这段前置工作的——你得知道目标流程每笔交易的成本、每一步花多久、错在哪里,否则后面根本没得比。
这一步人人都跳,而跳过它正是为什么那么多项目半年后答不上"到底值不值"。正如 Bernard Marr 在 Forbes 指出的:最常见的失败是没人在一开始就定义"值"长什么样——于是 agent 上线了,大家点点头,然后谁也证明不了它挣回了自己的成本。先把基线写下来。它不必完美,但必须存在。
第二步——算全部成本,不是标价
订阅那一行是 agent 成本里最小的一块。一个诚实的分母应该包含:
- 平台或 API 费用——那个显眼的月费。
- token / 算力用量——是变量,量一大就容易估少。
- 搭建与集成时间——接通它、写提示词、把它接进工作流所花的工时。
- 持续的复核与监控——每次检查 agent 输出并纠正它的那部分反复投入的人力。
最后一行正是大家会漏的,而它很少是零。任何会动到"不好撤销"的东西的 agent,都需要一个人在环的关卡,而那份复核是真实的、反复发生的成本——不是可以四舍五入掉的零头。Marr 在 Forbes 的另一个要点也落在这里:agent 的 ROI 不是算一次就完事。它每周都在复利或者衰减,取决于有没有人在看真实输出、调它、把它做错的地方反馈回去。把这份时间算进去,不然你的 ROI 数字是虚的。
第三步——选一个诚实的指标,按节奏反复量
核心公式很朴素:ROI =(获得的价值 − 总成本)÷ 总成本,见 IBM 自己的 ROI 指南。难的是选一个你真能量、也守得住的价值指标——某件具名任务省下的小时数、每单已解决工单的成本、出错率,或每周吞吐量——而不是一句含糊的"效率提升"。然后像审任何投资一样,按同样的节奏反复量。上线时量一次几乎什么都说明不了;八周的趋势才告诉你该留、该调,还是该砍。别为了让数字好看而回填那些"软"收益——如果硬指标不动,那本身就是结论。
一个真实例子:Issue #001 背后的数字
你不需要企业级的一整套栈也能这么跑。拿 Issue #001 里那个 Gmail 分拣 agent——一个有真实数字、写清楚了的真实搭建:
- 基线(第一步): 在 agent 出现前,每天早上约 25 分钟盯着收件箱做分拣。
- 全部成本(第二步): Claude 订阅每月 $20、一次性约 20 分钟搭建,加上每天早上几分钟扫一眼输出、把行动项抄进任务管理器。
- 指标(第三步): 每天省下的分拣分钟数,以及优先级判断的准确率——而这个准确率是在纠正提示词 5–7 天后才到约 90% 的。
现在诚实地算这笔账。把你自己的时间按一个你守得住的费率计价,乘以约 25 分钟 × 工作天数,再减掉那 $20 和复核的分钟。这算不算过了你"值不值"的线,是你的判断——但注意诚实版逼你承认的东西:头一周 agent 是净亏的,那会儿准确率还在爬、你还在纠正它。那是复利曲线,不是上线当天的奇迹。这也是为什么可复现、桌面级的那种搭建才值得量——每个输入都看得见,所以每个数字都能追回到你能核对的东西上。
关于回报,诚实地说:企业的胃口是真的——Zapier 的 State of agentic AI adoption 调研(2026)显示多数企业已经在用或在测 agent,且很大一部分计划加大投入。但胃口不是 ROI。上面 IBM 和麦肯锡的数字提醒你:花钱容易,回报要挣——靠基线、靠工作流重做、靠反复量,而不是靠工具本身。刚入门?先看 Agent 101,然后像审任何投资一样去量你的第一个 agent。
FAQ
AI agent 的 ROI 怎么算? 用 ROI =(获得的价值 − 总成本)÷ 总成本,见 IBM 的 ROI 指南。功夫在输入上:上线前先给这件事今天的成本(时间、金钱、出错)立基线,把全部成本算进去(订阅、token、搭建、人工复核),再选一个你能量的价值指标——省下的小时数、每单成本、出错率。然后按节奏反复量,而不是信一次上线当天的数。
衡量 AI agent ROI 时大家常漏算哪些成本? 量一大就上去的 token / 算力用量、搭建与集成的工时,以及最常被漏的——检查并纠正 agent 输出的人工复核时间。任何会写、会动作的 agent 都需要一个复核关卡,而那份时间是反复发生的成本,不是零头。漏掉它,你的 ROI 数字就是虚的。
为什么大多数 AI agent 项目达不到 ROI 目标? 因为它们既跳过了基线,也跳过了工作流重做。IBM 2025 CEO 调研发现只有 25% 的 AI 项目达到了预期 ROI,麦肯锡发现与真实影响相关性最强的因素,是彻底重做活儿怎么干——而不是把 agent 硬塞进旧流程。
AI agent 的 ROI 多久能见到? 一开始大概率是净亏的,那会儿你还在调它。在 Issue #001 里,agent 的优先级判断是在纠正提示词 5–7 天后才到约 90% 准确率的——意味着回报是几周里复利出来的,不是第一天就有。量趋势要看一两个月,别只看一周。
个人(非企业)的 agent 也能量 ROI 吗? 能,方法完全一样,只是跑起来更便宜。上线前给任务计时,上线后把订阅费和你的复核分钟加起来,再追一个指标,比如每天省下的分钟数。Issue #001 这个例子完全是在个人层面跑的。
每周一个真实的 AI agent,诚实地量给你看,直接发到你邮箱。免费,不推销。