E-Commerce Bench:长程经营,多维评估
PAPER GITHUB PROJECT 过去几年的Agent评测模式大体是给定目标,模型在有限回合里尽量达成。比如在一个迷宫里找到宝藏、产出一份报告或者修复一段代码。而模型的性能也会根据交付产物的质量或者任务完成度来评估,这类评估往往有明确的自然终止状态。 真实世界的长程任务大多没有明确的自然终止态,例如天气预测、股票交易、商业经营。就像网店不会在某个上午被"经营完成",上个月压的库存、前天谈判的价格、昨天的促销活动都会影响今天的销售,Agent需要在动态的市场中不断调整经营策略来实现长期的盈利目标。 为了评估模型的长程经营能力,我们联合淘天集团发布了 E-Commerce Bench ,评估模型作为电商商家在真实市场中经营网店的能力。模型需要在有限的时间和资金约束下,进行一系列经营决策,并且需要应对市场的变化和不确定性。 10万本金,365天持续经营 # Agent会拿到10万元本金并且可以同时开多家店,在长达一年的时间里和真实卖家一样,每天要调研品类、跟供应商砍价、定价上架、盯促销节奏、管库存和现金流。环境不告诉它市场需求上限在哪,也不告诉它成本底价是多少,全靠自己探索。一年结束