AIDEEPAI 深度拆解
← 全部拆解
· 美团 LongCat 团队 / 新加坡国立大学等decode

给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」

原文:https://arxiv.org/html/2605.27141v1

agentbenchmark长期记忆个性化主动性美团LongCat评测RAGAgentic-Memory
给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」 配图 1

过去两年,agent 基准比的是一道难题做不做得完:把外卖、订座、订机票串成一条工具调用链,看模型会不会中途掉链子。美团 LongCat 团队半年前发的 VitaBench(1.0)就是这一路的代表——66 个工具、跨场景复合任务,最强模型成功率卡在约 30%。

VitaBench 2.0 换了考法,也换出了一个更刺眼的数字:把一个用户长达 1580 天的全部交互历史原封不动塞进模型的上下文窗口——这是作弊式的能力上界,模型什么都看得见——最强模型 Claude-Opus-4.6 的平均成功率仍然只有 0.503。给它全部信息,它也只考 50 分。

这件事比「30% 跨场景成功率」更值得做 agent 的人停下来。30% 说的是「这道题太难」;50%-with-full-context 说的是「难的不是题,是模型根本不会用关于你的信息」。

VitaBench 2.0 到底在考什么

一句话:考模型能不能跨天、跨会话地记住并服务同一个人。

它由美团 LongCat 团队联合新加坡国立大学、中国科学技术大学、北京邮电大学、浙江大学构建,2026 年 6 月上旬开源,MIT 协议,代码和数据集都在 meituan-longcat/VitaBench-2.0。场景沿用 1.0 的三块美团自家业务——外卖配送、到店消费、在线旅游。

规模上它把「长期」做实了:56 个虚拟用户,819 个任务,2000 多条随时间演变的动态偏好,66 个可执行工具,平均每个用户的交互跨度长达 1580 天,平均经历 48 次以上的偏好变化(按美团技术稿口径;GitHub README 另写为 771 个子任务,两个口径有出入)。任务不是一道道孤立的题,而是按时间排成序列——同一个用户先有一堆零散的对话和行为日志(浏览、下单、评价、搜索),然后才轮到 agent 接一个新请求。

「动态」体现在偏好不是固定档案。一个用户的口味会增加、删除、修改:上个月还忌口香菜,这个月开始接受了;以前只点商务酒店,最近开始订民宿。基准把这些漂移事件埋进交互流里,还故意往里掺了约 20% 的噪音——无关闲聊、随手探索、代理别人下的单——逼模型从混杂信息里分辨出哪些才是这个用户的真实长期偏好。

考核拆成四个维度。三个属于个性化:偏好抽取(从碎片化交互里推断没明说的偏好)、偏好运用(把推断出的偏好用进决策)、偏好更新(偏好变了能不能跟着改)。第四个是主动性:信息不足时主动追问或探索,而不是硬着头皮替用户拍板。

给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」 配图 2

真正的考点不是「记不记得住」,是「记忆架构怎么搭」

VitaBench 2.0 最该被工程师注意的设计,是它把记忆机制本身变成了对照变量。同一批任务,跑三种记忆设置:

Full Context——把全部历史拼进 prompt,是能力上界,也是绝大多数人不会真用的奢侈方案。Agentic Memory——让 agent 自己维护一份结构化的用户档案,自己决定记什么、改什么。RAG Memory——把历史切片、做向量索引,用到时按相似度检索回来。后两种才是生产里真正会用的方案。

结论很直接:大部分模型从 Full Context 换到记忆机制都掉分。论文给出的判断是,记忆机制对长期用户建模是必需的,但当前 agent 还不会有效利用记忆。这句话翻译成工程语言:你那套 RAG 召回 + 拼 prompt 的记忆方案,瓶颈大概率不在召回率,而在模型拿到召回结果之后不会用。

这正是这个基准对从业者的价值所在。它不是又一个刷分榜,而是一套现成的记忆方案对照实验台——你可以把自己的 agentic memory 或 RAG 管线接进去,在 56 个用户、1580 天跨度上测一遍,直接看你的记忆架构相对 Full Context 上界掉了多少分。这比在自己业务上拍脑袋调 prompt 要可量化得多。

给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」 配图 3

给了真值偏好,成绩还是 50%

最反直觉的一组发现,是个性化为什么是头号瓶颈。

按常理,模型答不好是因为没推断对用户偏好。但 VitaBench 2.0 做了个对照:直接把正确的用户偏好(ground truth)喂给模型,省掉推断这一步。成绩依然卡在 50% 左右。问题不在「猜不准」,而在猜准了也用不好——模型在对偏好做推理、排优先级、跨任务保持一致地应用这件事上能力不足。

第二个发现冲着 reasoning 信仰来:开启 thinking 模式并不稳定地带来更好成绩。这个基准上,最强 thinking 模型 Claude-Opus-4.6 是 0.503,最强 non-thinking 模型 DeepSeek-V4-Pro 是 0.456,差距没有想象中大。换句话说,长期个性化需要的能力和通用推理不是同一回事——堆思维链解决不了「这个人到底是谁」。

第三个发现最该让做产品 agent 的人警觉:主动性是全场最低分。在信息不足的任务上,领先模型得分只有 27%-28%,远低于个性化任务的 44%-50%。模型往往意识不到自己掌握的信息不够,于是硬猜——该问的时候不问,是当前 agent 一个系统性的盲点。一个会替你订餐的助理,最危险的不是订错,是它不知道自己该先问你一句。

给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」 配图 4

为什么「长期」是 agent 基准的下一个战场

τ-bench、WebArena、AgentBench 这一代基准,本质都在测同一件事:给一个明确目标,agent 能不能在一个 session 里把工具调用链跑通。它们假设用户是无状态的——每道题都是一个全新的人,没有过去。

但真实产品里的 agent 不是这样用的。一个助理、一个客服、一个推荐引擎,服务的是同一个人,一服务就是几个月甚至几年。在这个设定下,决定体验好坏的不再是单次任务的工具编排正确率——那件事,VitaBench 2.0 自己也承认,工具调用错误率已经显著下降,早就不是核心瓶颈。决定体验的是另外两件单次基准根本测不到的事:跨会话的记忆架构,和不确定时的主动策略。

长期记忆方向此前不是没有基准,但 LoCoMo、LongMemEval 这类大多停在「记住对话内容、回头能答对问答」,不带真实工具执行,也不模拟偏好漂移和主动性。VitaBench 2.0 的位置,是把「长期记忆 + 真实工具 agent + 偏好动态 + 主动性」第一次焊在一个评测里。这也解释了为什么是美团做——外卖、到店、旅游天然就是长期、多会话、强个性化的生意,自家业务给了它别人没有的真实场景模具。

给模型全部历史,它还是只考 50 分——VitaBench 2.0 把 agent 战场挪到了「长期」 配图 5

盲区:我们不知道的

56 个用户是人工精心构造的虚拟画像,不是真实线上日志的脱敏采样。基准的多样性与真实用户分布之间有多大差距,论文没有给出可对照的证据,泛化性存疑。

任务总数有三个口径——GitHub README 写 771 个子任务,论文和中文转述写 819 个任务,论文正文又说每个用户至少 10 个。本文采用 819(中文一手转述最一致),但这种基础数字的不统一,值得使用者在引用前自己核一遍。

三个域全是美团生活服务。一个在这套基准上拿高分的记忆架构,能不能迁移到企业知识库助理、代码 agent、医疗问诊这些偏好结构完全不同的场景,没有证据,只能存疑。

主动性指标怎么客观打分也是个开放问题。「什么算该问而没问」这件事,论文给了 rubric,但具体到一个 borderline 案例上由谁、按什么标准判,外部难以复核——而这恰恰是全场最低、也最容易因评分口径波动的那个维度。

对从业者意味着什么

如果你的 agent 服务同一个人很久——助理、客服、长期推荐——就别再拿单次任务基准的高分骗自己。那个分数测的是你早就不缺的能力。

第一件该做的事是把记忆架构当成一等公民来测,而不是当成 RAG 的附属。VitaBench 2.0 把 Agentic Memory 和 RAG Memory 放在统一框架下对照,等于免费给了你一个「我的记忆方案离上界差多少」的标尺。接进去测一遍,比在业务数据上盲调有数得多。

第二件事是给 agent 装上「主动问」的策略。27% 的主动性得分说明,光靠 prompt 里写一句「不确定就提问」远远不够——模型识别不出自己什么时候不确定。这是一个值得单独投入工程量的子问题:什么信号触发追问、追问的成本和体验如何平衡,目前没有现成答案,谁先解决谁占便宜。

第三件事是放下「上更强的 reasoning 模型就能解决长期个性化」的幻想。这个基准的数据表明,thinking 和长期个性化不是同一条能力曲线。该投的地方是记忆系统和交互策略,不是再换一版思维链。

本期关键词

  • VitaBench 2.0 —— 美团 LongCat 团队联合多所高校于 2026 年 6 月开源(MIT 协议)的智能体评测基准。考核重点从「一次性任务做没做完」改成「跨越平均 1580 天、跨会话地记住并服务同一个人」。用 56 个虚拟用户、819 个任务、2000+ 动态偏好、66 个工具,量化长期个性化和主动性能力。
  • 长期/动态智能体基准 —— 不同于单次任务基准(如 τ-bench、WebArena,假设每道题都是无状态新用户)。长期基准里任务按时间排成序列,同一用户的偏好随时间增删改,模型必须跨会话维持对用户的理解。考点从「工具链对不对」变成「记忆架构和主动策略行不行」。
  • Agentic Memory vs RAG Memory —— 两种生产里常用的记忆方案。Agentic Memory 让 agent 自己维护一份结构化用户档案,自行决定记什么、更新什么;RAG Memory 则把历史切片做向量索引,用到时按相似度检索。VitaBench 2.0 把它们和「全历史塞进上下文」的上界放一起对照,看真实记忆方案离上界差多少分。
  • Avg@4 / Pass@4 / Pass^4 —— 同一任务跑 4 次独立运行(temperature 0.0)后的三种统计。Avg@4 是 4 次平均成功率(看整体水平);Pass@4 是 4 次里至少成功 1 次的比例(看能力上限);Pass^4 是 4 次全部成功的比例(看稳定性)。Pass^4 普遍只有约 0.3,说明模型即便偶尔做对,也很难稳定复现。
  • 主动性(Proactiveness) —— agent 在信息不足时主动追问或探索、而非硬猜的能力。VitaBench 2.0 专门设计了一类信息不完整的任务来测它。领先模型在此项只有 27%-28%,是全场最低——模型往往意识不到自己掌握的信息不够。
  • LongCat —— 美团自研大模型及其团队。代表作 LongCat-Flash 是总参 560B、激活约 27B 的混合专家(MoE)模型,2025 年 9 月开源。VitaBench 系列基准即出自该团队,依托美团外卖/到店/旅游的真实生活服务场景构建。

引用

  1. VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions(arXiv 2605.27141) —— 一手论文
  2. GitHub: meituan-longcat/VitaBench-2.0 —— 一手代码与数据集(MIT)
  3. VitaBench (1.0) 项目主页arXiv 2509.26490 —— 对比基线,ICLR 2026
  4. 腾讯新闻:美团发布智能体新基准 VitaBench —— 二手交叉验证(发布机构与时间)
  5. OpenI:VitaBench 2.0 技术解读 —— 二手(1580 天跨度、48 次偏好调整、20% 噪音等口径)
  6. 量子位:美团首个开源大模型 LongCat 追平 DeepSeek-V3.1 —— 二手(LongCat 背景)