专用AI工作负载提供商Micro1已达到5亿美元年化运行率,反映出对专用推理基础设施的需求激增。
Micro1 报告称,其年度总运行率(gross annual run rate)在短短八个月内从 1 亿美元飙升至 5 亿美元。这家人工智能数据初创公司通过将机器学习开发者与主题专家联系起来实现了这一增长,这些专家负责创建和评估用于完善 AI 系统日益专业化的数据集。与此同时,对 AI 基础设施的投资也在激增,这凸显了构建先进模型的另一个迅速攀升的成本:数据本身。
虽然开放的互联网为早期一代 AI 模型的训练提供了充足的材料,但如今要获取推动更复杂系统进一步发展的精确数据却变得困难得多。
Micro1 将自己定位在这一挑战的中心。该公司不仅仅为基本的数据标注提供大规模劳动力,而是招募拥有深厚技术专长的专业人士,并在这些专家与寻求提升模型的人工智能公司之间促成合作。
这种价值主张并非 Micro1 独有。Mercor 和 Handshake 等竞争对手,以及该领域的其他几家公司,也在扩大其业务规模,这些业务建立在向 AI 开发者提供人类专业知识的基础上。该行业的快速扩张表明,推进模型能力并没有减少对开发过程中人类参与的需求;相反,它改变了所需专业知识的性质。
Micro1 由 Ali Ansari 于 2022 年创立,他曾公开谈论过公司数据的最终归属问题。上个月,Ansari 在 X 平台上发帖表示,Micro1 不会将其数据出售给中国模型开发商。他写道:“一些人类数据公司与外国对手合作。[A]nd the results show today in Kimi K3. We believe it’s shameful to claim American AI dominance desires while selling millions worth of data to countries that we are in adversarial competition with.”(注:原文此处保留了英文引语片段,意指“结果今天体现在 Kimi K3 中。我们认为,一边声称渴望美国 AI 的主导地位,一边将价值数百万美元的数据出售给我们与之处于对抗竞争状态的国家,是令人羞耻的。”)
除了人类专业知识外,财务利益也延伸至其他领域。据报道,Mercor 今年夏天的年度总年化收入已超过 20 亿美元,而 Handshake 在今年早些时候突破了 10 亿美元的门槛。与此同时,现有的专有数据集也吸引了大量的商业关注。
在最近的一个案例中,在 Spirit Airlines(精神航空)破产后,Micro1 以 1250 万美元的价格收购了该公司的企业数据,击败了谷歌提出的 1000 万美元报价。这场不寻常的拍卖突显了 AI 数据繁荣的另一个维度:企业不仅在资助新训练材料的创建,还在积极收购无法从公共互联网上抓取到的专有数据集。
专有数据的溢价主要源于其排他性。领先的 AI 开发者通常共享相同的公共网络内容访问权限,并拥有大量资本投资于训练和部署模型所需的计算能力。相比之下,企业内部数据则独具特色。它代表了多年交易、运营流程和客户互动的累积产出——这些资产是竞争对手难以轻易复制的。
随着 AI 开发者寻找能够从日益强大的模型中榨取更多性能提升的数据,这种区别变得更加关键。尽管网上存在海量信息,但其中很大一部分已被 AI 训练彻底消耗殆尽。由于公共数据对竞争对手同样可及,仅依赖这些数据使得获得竞争优势变得越来越困难。
独特的私有数据集可以引入模型此前未曾遇到的新模式和见解。因此,追求 superior AI 的竞争越来越演变为争夺竞争对手所不具备的信息的竞争。
对于人工智能行业以外的组织来说,这一转变提出了一个根本性问题:它们已经积累的信息的实际货币价值究竟是多少?
历史上,大多数企业数据是为了支持日常业务运营或满足监管要求而生成的,而不是为了训练机器学习模型。专门愿意购买非常规数据集的买家的出现,可能会有效地赋予这些遗留信息第二重商业目的。
然而,将企业记录转化为适合 AI 使用的资产仍然非常复杂。隐私法规、知识产权纠纷和商业敏感内容对企业能够或愿意披露的内容施加了严格的界限。因此,任何给定数据集的效用将很大程度上取决于其质量以及购买它的 AI 开发者的具体目标。
尽管存在这些障碍,数据正逐渐从单纯的业务副产品转变为具有自己市场的独立资产类别。Micro1 最近的轨迹为此市场可能的演变提供了早期的预览。