跳到主内容
南宫娱乐

阿里拟投3亿美元抢"判卷权":大模型下半场,谁定义"好",谁决定下一代

2026-09-28 · 周立群 · 更新于 2026-09-29

有消息称,阿里巴巴计划领投AI评测及后训练企业UniPat,金额约为3亿美元,估值接近25亿美元,腾讯与现有投资方红杉中国也被曝可能参与。需要事先说明的是,这笔交易仍处于协商阶段,具体金额、估值、条款及最终投资方均未确定,远未达到“已完成”状态,后续仍存变数。

不过,比交易本身更值得关注的是UniPat这家公司所触及的议题。该公司成立于2025年底,创始人李宽是90后,创业前曾在阿里通义实验室实习,参与通义DeepResearch项目,从事后训练分析、数据合成与强化学习工作。团队曾开展WebSailor等复杂推理研究,发布过BabyVision、SaaS-Bench、EvoCode-Bench、Terminal-X等多个评测集,聚焦软件工程智能体、浏览器操作、企业SaaS长流程任务等领域。

将这家公司简单定义为“AI考官”,未免低估了它。其真正占据的位置,是大模型下半场中最容易被忽视的一环:模型完成答题后,由谁来评判、如何纠错、以及如何将纠错转化为下一轮训练信号。而这一环节,恰恰是当前行业最稀缺、也最容易被资本忽视的领域。

模型答完题之后,谁来判断?

大模型的上半场,比拼的是参数规模、算力与语料。判断模型优劣,依赖的是Benchmark——输入问题,输出答案,计算准确率。这套方法在“答题”时代足够实用,也较为简单。

然而,进入Agent时代后,这套方法便失效了。因为Agent的任务不再是单一问题,而是一系列连续动作:理解环境、规划步骤、调用工具、修改代码、查询数据库、处理异常、回滚操作、提交结果。中间数十个步骤,只要有一个偏离,最终答案再完美也无济于事。传统的静态题卡无法测出“它是否真能完成任务”。

UniPat所做的第一层工作,便是“生产级评测”:并非询问模型“是否知道”,而是将其置于近似真实的环境中,检验其能否完成任务。SaaS-Bench将23个真实开源SaaS系统装入Docker,运行106个跨应用长流程任务;EvoCode-Bench考察多轮需求变更下的连续开发;Terminal-X测试复杂工程任务与版本升级。这相当于将评测从“判卷”升级为“实战演练”。

举个最直观的例子。传统Benchmark考核一道数学题,模型答对即为优秀。但在Agent场景中,模型接到“帮客户修改ERP中的采购单”任务时,它需要先理解需求,再找到正确页面,再修改字段,再保存,再确认未破坏其他数据。中间任何一步中断,任务便失败——即使最终输出的话语很漂亮。这正是“答题型评测”在Agent时代彻底失效的原因:它测量的是“模型是否知道”,而企业真正关注的是“模型能否完成任务”。

但真正有价值的,是第二层。

评测完成后,最有价值的并非分数,而是失败轨迹:哪一步决策出错、验证器为何拒绝、人工Rubric如何扣分、换一条路径是否能收敛。这些轨迹、中间状态、验证信号与偏好标注,可直接用于SFT、奖励模型或强化学习。

于是,闭环得以形成:评测发现弱点 → 切取失败轨迹 → 标注Rubric与偏好 → 合成训练数据 → 后训练更新策略 → 再次评测 → 再次发现弱点。UniPat销售的并非一次性考试,而是模型持续改进的反馈回路。报道中也提到,它与阿里的合作主要围绕强化学习后训练数据,先在较小模型上进行低成本实验,筛选出有效方案后再放大。这种“先小后大”的策略,本身就是后训练数据业务最务实的路径——小成本试错,成功后再规模化。

“判卷权”:谁定义好,谁决定下一代

“判卷权”这个词,准确翻译过来,实则包含三样东西。

第一是任务定义权。什么叫“完成”?是末端JSON正确,还是跨系统状态一致?是代码能运行,还是测试通过且不影响既有逻辑?任务如何设定,模型便被逼着朝哪个方向努力。出题的人,实际上在决定模型的方向。

第二是评分标准权。依靠规则验证器,还是依靠Rubric加人工专家?过程分如何分配?安全、合规、成本、可回滚是否纳入目标函数?标准一旦改变,模型的强弱排序便会彻底改写。

第三是反馈数据权。最稀缺的并非“问题—答案”,而是“环境—行动—结果—奖励”。谁能稳定生产可验证的轨迹,谁便卡住了后训练的供给端。

因此,“判卷权”等于评价标准加奖励信号加训练数据来源。它值钱,并非因为某套Benchmark有多权威,而是因为模型可以更换,但反馈层会被反复调用。谁掌握了“什么算好”的定义权,谁便参与了决定下一代模型走向的过程。

这三样东西环环相扣。任务定义决定了模型被训练去做什么,评分标准决定了模型被训练去优化什么,反馈数据决定了模型用什么信号去改进。一个掌握全套能力的公司,等于握住了“什么算好”这个终极问题的答案。而在大模型的下半场,这个答案比“谁的参数多”值钱得多——因为参数可以堆砌、算力可以购买,但“好”的定义权,只有一个。

阿里腾讯罕见同框,和三道绕不过的坎

阿里的逻辑最为直接。通义需要后训练,阿里云的企业客户需要验收。模型在公开榜单上排名第几,企业并不买单;能否进入ERP修改单据、进入客服系统闭环工单、进入研发流通过单元测试,才决定采购决策。若UniPat这类能力嵌入阿里云的交付标准,便相当于将“模型是否可行”的验收尺子掌握在自己手中。再加上前通义人员的信任链,技术对齐成本较低。

腾讯若跟投,逻辑则不同:它不一定押注UniPat某套Benchmark长盛不衰,而是押注“模型中立”的反馈基础设施。微信、企业微信、广告、客服,未来无论接入混元还是外部模型,都需要回答“Agent是否稳定、流程是否通畅”。投资评测层,比押注单一模型更为底层——模型会更换,但“验收”这件事,永远需要一把尺子。

阿里与腾讯罕见同框,信号并非源于感情,而是共识:评测与后训练数据并非配套小功能,而是Agent时代的采购前置条件。

但闭环之外,还有三道坎,绕不过去。

第一道是中立性

阿里领投、腾讯跟投,客户却包含其他大模型厂商,公信力自然会受到质疑:是否会为自家模型放松Rubric?Scale AI便是前车之鉴。UniPat要么将验证器做得透明,要么将商业评测与公开Benchmark拆分,否则“考官”迟早会被质疑为“自家教练”。在中文AI圈中,这尤其是一道绕不开的关卡——因为客户与股东,本身就是同一批巨头。

第二道是收入

目前能确认的是评测集与技术口碑,无法确认的是可持续的合同与毛利结构。后训练数据定制客单价较高,但依赖头部实验室的预算——头部一旦收缩,收入便会波动。

第三道是工程

真实SaaS环境、浏览器环境、多工具调用,维护成本极高。Benchmark被刷是常态,验证器漏判会直接污染奖励信号。能否将评测变成可调用的RL环境,而非发布榜单后便过时,决定它最终是数据公司,还是基础设施公司。

这三道坎,其实是一件事的三个侧面:UniPat想做的是“中立的基础设施”,但其大股东之一正是模型厂商阿里,其收入又依赖这些模型厂商的预算,其工程又必须时刻跟上模型的进化。一个想充当中立裁判的公司,同时要讨好选手、靠选手吃饭、还得比选手跑得快——这个处境,注定它每一步都走在钢丝上。

回到那笔传闻中的3亿美元。大模型上半场比拼谁参数大、谁卡多、谁语料狠;下半场比拼的是,模型出来后,如何知道它真的变好了,而非仅在榜单上变好了。预训练依赖互联网存量,后训练依赖可验证反馈。Agent一旦落地,正确答案不再是单点输出,而是长轨迹中的状态一致、工具成功、异常恢复、业务可验收。

资本关注UniPat,并非关注其当前收入,而是关注它能否成为模型公司的反馈神经系统:测试模型、发现弱点、产出数据、提供奖励、再训练模型。交易是否落地另当别论,方向已经显现——选手还会继续竞争,考场也开始被争夺。而考场一旦被抢下,下一场比赛的规则,便不再由选手自己决定了。

更多文章