沃创沃创
洞察

能淘汰糟糕押注的 AI 试点经济性评估

一个能给出巧妙答案的试点并不能证明这是一门生意。AI 试点经济性评估要提出的正是那个被演示驱动型采购所回避的问题:在把工程师、模型调用、工作流变更、安全审查和人工例外处理都算进去之后,这件事创造的经济价值是否超过它所消耗的?

大多数试点从未回答这个问题。它们被设计成证明模型能在有利条件下完成某项任务,而这通常是整个机会中最无趣的部分。真正困难的地方在于:这项任务是否足够频繁地发生、是否足够重要、能否以足够低的成本嵌入,从而改变客户的运营行为。

对创始人而言,这是一款有前景的产品成为受信任、能产生收入的基础设施,还是仍旧只是一个配有精美屏幕录像的昂贵功能的分水岭。对投资者而言,这是投资能力与投资表演之间的区别。

试点不是产品

试点是一次期权购买。客户花费有限的资金和组织注意力,来了解这项变革是否值得承受随之而来的干扰。这使得试点很有用,也使它很容易被误读。

客户可能会派出最配合的团队,提供异常干净的数据,并安排一位高管发起人来清除障碍。在规模化时,这些默认情况下都不存在。因此,一个试点可以展示技术可行性,却掩盖了运营上的不可行性。

那种常见的失败模式很简单。一家公司报告了高准确率、热情洋溢的用户评价,以及一份签署的试点协议。然后部署时需要定制集成、为每个客户调整提示词、昂贵的人工审查,以及一个增长速度快于收入的支持模式。试点成功了,生意却没有。

这一区别应当塑造每一次商业对话。不要问用户是否喜欢它。要问他们停止了做什么、消除了什么风险、有什么预算能为此买单,以及当客户是五十家而不是一家格外有耐心的设计伙伴时,服务成本会是什么样子。

AI 试点经济性评估必须衡量什么

一次有用的评估始于经济单元,而非模型。定义正在被改变的那项工作,以及今天完成它的基准成本。如果客户无法用人力、延迟、错误、收入流失或风险敞口来描述现有的工作流,那么就还没有可信的回报计算,只有兴趣。

基准必须包含那些令人不快的部分:寻找输入所花的时间、核对输出、上报例外、纠正错误以及记录决策。AI 往往通过压缩这些周边工作来创造价值,而不是替换单一步骤。它也可能因为审查和治理而产生新的工作。两者都属于这道算术题。

然后计算试点的全负荷成本。这不只是软件费用和推理账单,还要包括实施人力、集成工作、数据准备、客户成功、安全与法务审查、模型监控、支持以及人工兜底。一个低模型成本的叙事可能看起来很吸引人,而与此同时交付团队却悄然变成了一家定制服务公司。

评估应当把通常被混为一谈的四件事区分开:

一个试点可能在第一项指标上表现出色,却在其余三项上失败。这不是一个次要的附加说明,它通常就是整个投资理由的全部。

衡量真实发生的行为,而非声称的热情

用户访谈很重要,但很容易带有奉承。人们常常会称赞一款由他们经理发起的工具,尤其是在有人做记录的时候。使用行为则没那么客气。

寻找的是在正常工作流中的重复使用,而不是入门期间的一阵活跃。追踪已处理的合格案例比例、用户接受输出还是编辑输出的比率,以及仍需专家介入的工作量。如果这款工具只有在专家站在背后时才管用,那么这位专家就是产品成本的一部分。

采用度还需要一个对照组。如果一个团队在试点期间变快了,要弄清楚还有什么发生了变化:人员配置、流程清理、季节性业务量、高管的关注,或是一份新记录的操作手册。把全部改善都归功于模型,正是内部创新报告如何变成虚构故事的方式。

经济性会在例外队列中崩溃

平均表现是一个令人安心的指标。而例外队列才是经济性走向消亡的地方。

设想一个系统能快速处理常规案例,但将一小部分工作转给人工审查。如果原本的工作流每个案例都需要人工,且这些例外处理起来成本低廉,那它可能仍然有吸引力。但如果识别、解释和补救糟糕输出所花的时间超过一开始就把工作做对所需的时间,那它就没有吸引力了。

这就是为什么单一的准确率数字很少足够。错误的成本取决于它发生在何处、由谁发现,以及补救需要什么。一份错误的内部草稿可能无伤大雅。而在受监管流程中的一个错误操作可能会带来一笔足以压垮任何节省的审查负担。

创始人至少应当为三种运营情形建模:预期情形、输入杂乱且采用度较低的客户环境,以及延迟、支持和审查压力显现的高业务量情形。当情形模型只有一条向上的直线和一条向下的云成本线时,投资者应当保持怀疑。系统不会仅仅因为一张电子表格乐观就变得经济上可靠。

还有一个不那么光鲜的问题:谁来承担失败?如果客户必须保留同一支团队、增加审查人员,并接受对错误的不明确问责,那么该产品并没有替代一个成本中心,而是增加了一层软件和政治风险。价值主张必须大到足以为这两者买单。

为结果定价,而不是凭空捏造一个结果

基于结果的定价之所以流行,是因为它承诺了利益一致。它也被那些无法衡量结果、也无法控制背后变量的团队所滥用。

当因果路径站得住脚时,就针对一个真正的经济事件来定价。那可以是一个完成的工作流、经核实的处理时间缩减、一类避免的损失,或是从瓶颈中释放出来的产能。如果结果在很大程度上取决于客户行为、上游数据质量,或是产品无法控制的销售团队,那么纯粹的结果收费可能带来纠纷而非信任。

在许多情况下,一种混合结构更为诚实:一笔覆盖持久系统的平台费,加上与透明的使用量或价值指标挂钩的可变部分。重点不在于财务上的精明,而在于确保随着部署规模扩大,毛利率能够改善。

创始人应当能够不用玩杂技就回答三个商业问题。试点之后客户要付多少钱?公司必须做哪些工作才能赚到这笔收入?要让下一个客户比上一个部署得更快、更有利可图,需要满足什么条件?

如果答案是“等我们拿下更多客户标志再想办法”,那么这家公司并没有验证一个进入市场模型。它只验证了会有人愿意开一次会。

试点之后的决策关口

每个试点都应当以一个事先商定好的决策关口收尾。不是一场展示会。不是一张画着彩色箭头的幻灯片。而是一个决策。

在试点开始之前,就定义好基准、合格的工作流业务量、最低采用门槛、可接受的错误率和审查率、预期的实施范围,以及通往生产的商业路径。设定一个日期,发起人必须在那时做出选择:扩大、重新设计、暂停,还是停止。

停止是一个正当的结果。事实上,它往往是可获得的回报最高的结果。一个失败的试点若能避免十二个月的定制产品工作,那并不是尽职调查的失败,而是尽职调查在履行它的职责。

对于审查一家拥有多个试点的公司的投资者来说,投资组合的整体模式比声势最大的案例研究更重要。客户是否正在转向付费生产?实施周期是否在缩短?产品是否变得更加标准化?收入是否无需创始人层面的介入就能持续?这些都是学习正在复利累积的迹象。而一堆用例各异、范围定制、缺乏转化纪律的试点,只是一份披着软件外衣的咨询待办清单。

沃创(SproutVest)把这项工作视为一次商业压力测试,而非对技术进步的庆祝。目标不是让一个试点看起来值得投资,而是判断其经济性是否配得上下一美元。

有用的下一步动作极为务实:拿出当前最强的那个试点,为每一项成本和每一项声称的收益指派一位负责人,并依据双方在结果揭晓之前都认可的数字,强制做出一个生产决策。如果这项练习让机会变小了,那就相信它。小而真实,比亮眼而虚幻更容易被建成。

您的领导方式在哪里有效,又在哪里正在消耗公司?

这个博客讨论的多数问题,最终都回到创始人如何经营公司这一点上。藤架领导力诊断把它拆成六个维度共24道行为锚定题:约12分钟,即时出结果,自助版免费。

开始藤架领导力诊断 →

想了解兼职高管或顾问合作?预约探索性通话 →

Book a Call