过去几年的Agent评测模式大体是给定目标,模型在有限回合里尽量达成。比如在一个迷宫里找到宝藏、产出一份报告或者修复一段代码。而模型的性能也会根据交付产物的质量或者任务完成度来评估,这类评估往往有明确的自然终止状态。
真实世界的长程任务大多没有明确的自然终止态,例如天气预测、股票交易、商业经营。就像网店不会在某个上午被"经营完成",上个月压的库存、前天谈判的价格、昨天的促销活动都会影响今天的销售,Agent需要在动态的市场中不断调整经营策略来实现长期的盈利目标。
为了评估模型的长程经营能力,我们联合淘天集团发布了E-Commerce Bench,评估模型作为电商商家在真实市场中经营网店的能力。模型需要在有限的时间和资金约束下,进行一系列经营决策,并且需要应对市场的变化和不确定性。
10万本金,365天持续经营 #
Agent会拿到10万元本金并且可以同时开多家店,在长达一年的时间里和真实卖家一样,每天要调研品类、跟供应商砍价、定价上架、盯促销节奏、管库存和现金流。环境不告诉它市场需求上限在哪,也不告诉它成本底价是多少,全靠自己探索。一年结束后,模型的表现将从多个维度进行评估,包括盈利、现金流管理、供应商谈判、反欺诈、运营效率、执行力和长程学习能力。
Figure 1: 四层架构,agent loop层管理回合和上下文,tool层给出电商运营工具箱,确定性environment层建模用户需求和供应商行为,数据层由真实淘宝&天猫平台数据驱动
为了还原真实电商平台,我们做了如下设计:
真实市场数据:6,886个商品分布在60个品类里,背后是576个供应商和12种可开的店型,全年日历上固定了10个市场事件、8场促销。品类销量、退货率、节庆这些直接脱敏自淘宝&天猫平台数据。
时间预算:一天从早八到晚六,只有600分钟可用,每次调工具都要扣时间。查个余额10分钟,开家店60分钟,给供应商发条消息30分钟。调研和动手花的是同一份预算,想清楚再动和边动边想,代价不一样。
三账户结算:所有成本直接从银行账户扣走,但收入要等发货之后,扣除佣金再进入平台担保账户,再过9天才到平台钱包,还得手动提现回银行账户才变回能用的现金。
仓储与快递:库存按件按天收仓储费,而且关店也停不下来,除非愿意亏本清货。快递速度也分三档,快的运费翻倍,慢的减半,超过两天没发出去的订单直接取消。
退货与信誉:退货率受四个因素影响:品类本身的基线、供应商发来的次品、定价高出参考价多少、以及选了哪档发货速度。后两个是模型自己能控制的。信誉分会直接乘在需求量上,退一单扣0.6,取消一单扣1.0,信誉掉到底的店只能拿到正常水平15%的流量。
确定性谈判内核与用户需求模型 #
如果市场需求和供应商行为都是随机的,模型之间的差距就会被噪声淹没,没有区分度和可复现性。
所以,用户买家这一侧完全不做采样。一个商品当天卖多少件,是通过品类基础需求、价格响应、周末、促销、季节性、当天事件、店铺信誉、市场需求上限等各个因子计算出来的。
Figure 2: 四种价格弹性曲线,以及一个SKU的销量如何被各种因子决定
供应商卖家这一侧则通过确定性内核来给出报价和让步策略并用模型渲染成真实对话。如果直接让大模型扮演供应商,会坏两件事:1.同样的谈判策略得到的报价会不一致,同一个Agent跑两遍碰到的价格都不一样;2.大模型本身是能被Hack的,不诚实的Agent能通过欺骗或者越狱攻击把价格谈到成本线以下,评测就变成了越狱比赛。所以我们把每个供应商拆成两层:
确定性谈判内核:供应商每一次报价、让步、接受还是离场,全部由内核算出来。保留价和开局报价是商品的固有属性,不是抽出来的。
NPC渲染层:LLM只负责把内核定好的决定说成人话,让Agent觉得自己在和一个真实的人谈判。
这样一来,多轮砍价的真实感还在,采样噪声却没了。
Figure 3: 谈判时双方报价会逐渐向中间收敛。在一整年的复购里,有的Agent会把历史成交低价抛诸脑后,有的会逐步把成交价压低
年终总资产只是冰山一角:七维能力拆解 #
我们对18个模型各跑了5轮完整评测,同样10万元起步,结果却差出几个数量级。GPT-5.6 Sol最终的资产达到了143万,是起点的14.31倍,而Qwen3.5-Plus平均却只剩1,100元。开源阵营里表现最好的是Qwen3.8-Max-Preview,回报4.16倍,但总榜前四名清一色是闭源模型。当然,强模型也不是稳赢:90次评测里有10个以破产收场,其中GPT-5.5有两次评测时在一月份就因为大量铺货而导致资金链断裂,那时候连一分钱销售款都还没结算到账。
Figure 4: 18个模型各5个年份的年末总资产,对数轴,红叉是破产回合,右侧是资产倍数与破产比例
只看年末那个数字,看不出这一年是怎么过来的。365天的曲线大致分三种形状:领先的模型从年初起就稳步往上爬;破产的回合掉下去再没回来,最早一条在一月就见底;中后段的模型整年贴着10万元本金线上下浮动,忙了一年等于原地踏步。
Figure 5: 18个模型的全年总资产,按年末均值排序,细线是单个回合,黑线是回合均值,红色虚线是10万元本金基线
破产的路子基本是同一条,一月把货压满,之后再也卖不出去。
Figure 6: 一个破产案例的逐日曲线,一个月内进货速度远超销售速度,仓储成本暴涨导致现金流断裂
赚得多不等于经营得好。所以除了年末总资产,我们还独立打了六个维度的分:谈判质量、反欺诈、现金流与清偿、运营效率、运营执行、长程学习。七个轴画成雷达图,图形明显是不规整的,每个厂商家族取一个模型,七个里有六个至少在一个轴上落到18个模型的中位数以下。
Figure 7: 七个厂商家族各一个模型的能力画像,虚线是18模型中位数,没有一个填满了它
分维度看,有几个发现比总资产本身更有意思。
谈判质量:没有哪个模型能把价格压到供应商的成本底线。我们给砍价能力打了一个0到1的分,其中0.5分意味着完全不还价、直接接受对方的开价。Claude Opus 4.7拿到了0.811,确实砍下了不少;Kimi K2.6只有0.596,比直接接受开价仅仅好出一点。还有一个值得注意的发现:同一个模型面对六种不同的供应商行为风格时,谈判表现差异并不大,而不同模型之间的差距,却是前者的四倍。
反欺诈:这是各模型差距最大的一项。流向欺诈供应商的采购占比,最高与最低相差超过160倍,Claude Opus 4.7仅0.12%,Qwen3.5-Plus高达20.11%。作为参照,名单上576家供应商里有152家是欺诈方,占26.4%。一个完全不做筛查、闭着眼把采购款平摊给所有供应商的买家,大约就会落在26.4%这条线上。18个模型全部低于这条线,说明所有模型都能筛掉一些欺诈者。赚得最多的GPT-5.6 Sol在这一项上只排第16位,一年下来倒也没因此翻车。真正的分水岭不在"挑谁聊",每个模型接触过的供应商里,欺诈方占比都跟26.4%差不多,差别在于聊完之后下不下单:Claude Opus 4.7接触的欺诈供应商中,最终下单的只有4.0%,而GPT-5.6 Sol则高达31.7%。
Figure 8: 流向欺诈供应商的采购占比,红线是完全不筛查的26.4%基线,右侧展示了这笔资金被五种骗局瓜分的比例
运营效率:把一年的利润折算到每次工具调用上,Fable5平均每次调用能带来479元的收益,比总资产第一的GPT-5.6 Sol的363元还高,调用数还少了59.9%。发货、快进到下一天、提现、上架这四件事占了总调用次数的71.8%,真正能改变进货成本的供应商对话只占6.0%,调价只占0.66%。时间的大头花在了不改变成本结构的动作上。
Figure 9: 每次工具调用带来的利润,以及六个模型把调用花在哪八类动作上
一年下来几乎没有模型将进货价压得更低 #
长程学习不好测,难的地方在于说不清"进步"该长什么样。这个环境里刚好有一把现成的尺子:卖方内核永远不会低于自己的保留价成交,所以Agent已经拿到过的最好价格,就是这个供应商成本线的上界,而且只会越来越紧。同一个供应商、同一个商品,下一次进货成交在历史最好价之上还是之下,不需要任何额外标注就能判断。
我们把每次重复进货的成交价换算成它在议价区间里的位置,再和"把已经拿到的价格随机重排"这个零假设进行对比,得到AnchorRatio,1.0表示模型的出价顺序和随机顺序看不出区别。8,647次重复进货里,18个模型只有2个低于1.0,中位数是1.369,15个模型朝更贵的方向偏离零假设超过两个标准差。模型对供应商的选择也在往坏的方向漂,17个模型年末成交里欺诈供应商的占比比年初还高。一年下来,模型并没有变得更会买东西。18个模型里只有Qwen3.8-Max-Preview有明显的长程学习的迹象,它的AnchorRatio是0.88,说明它在重复进货时能把价格往更低的方向压。
写在最后 #
构建E-Commerce Bench时我们反复纠结的一个问题是:要不要让LLM直接扮演供应商?答案最终是否定的。一旦对手方也是概率模型,Agent和供应商之间的博弈就会变成两次采样的叠加,Agent用同样的策略跑两遍结果完全不同,评测就失去了可比性。我们的方案是把经济决策全部固化进确定性内核,只留一层LLM渲染负责把数字说成人话。多轮博弈的体感保住了,随机噪声被挡在了评估之外。这个思路应该不止适用于电商谈判,用伪随机的确定性内核来保持可复现性,应该是长程任务评测的通用做法。
另一个体会是,单一指标会掩盖模型的真实表现。18个模型里没有一个能在七个轴上同时站稳,前三名各有短板掉到十名开外,垫底的反而可能在某一维不算最差。如果只看年末总资产,你会以为GPT-5.6 Sol全面领先,但它反欺诈排第16。长程任务的失败模式太分散了,不拆开看根本不知道模型到底弱在哪。
最后,E-Commerce Bench离饱和还很远。谈判、反欺诈、长程学习,每个维度上最好的模型都离满分还有明显距离。七个维度的最好成绩分散在六个不同的模型手里,前沿模型仍有很大的提升空间,也说明了本评估基准在衡量模型商业能力方面潜力巨大。
Citation #
@misc{fan2026ecommercebenchevaluatingllm,
title={E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation},
author={Wei Fan and Xinjie Shen and Xudong Guo and Jianhong Tu and Yang Su and Yinger Zhang and Lianghao Deng and Fengyu Wang and Baohua Dong and Yangqiu Song and Dayiheng Liu},
year={2026},
eprint={2608.30730},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2608.30730},
}