公开子集用于预检与复现,私有数据降低过拟合。
组织机构
主办:中国图像图形学会(CSIG)
承办:南京大学、浙江大学、Datawhale、CSIG 企业联络与标准化工作委员会
统一评测平台:Agent Memory Leaderboard(AML)
统一评测
让不同记忆系统,
在同一套规则下公平比较。
不同论文和产品常使用不同数据集、回答模型和评分模型,成绩难以横向比较。本赛事统一数据、接口、Answer 与 Eval,让参赛系统在同一套评测规则下比较长期记忆能力。
检索结果进入一致的 Answer 合约,隔离生成差异。
统一提示词、参数与评分器,保留审计证据。
统一评测协议
系统只负责记忆。
其他变量,交给平台。
清晰的责任边界,是成绩可比的前提。参赛方实现记忆写入与检索;平台统一完成回答与评分。
- 01WRITE
Add
接收记忆并完成内部处理
- 02RETRIEVE
Search
返回相关记录或证据
- 03GENERATE
Answer
平台统一生成最终答案
- 04SCORE
Eval
平台统一评分与复核
评测类型
文本、代码与多模态,
三赛道独立评测与排名。
三个赛道共用 Add / Search 接入方式和平台任务流程,但分别冻结数据、执行器与评分合同;各赛道的 Smoke、Full 和结果互不占用。
文本赛道共包括 6000 余个评测实例
覆盖 32 个数据来源
评测数据规模共近 300M Tokens
- 01 找回
- 02 记准
- 03 用稳
召回证据
从长期上下文中找到正确、完整且可追溯的信息。
显式事实召回
事实、属性、来源与实体信息
关系与多跳组合
跨片段证据与关系链恢复
时间与事件序列
日期、间隔、顺序与轨迹变化
形成稳定记忆
面对变化与个体差异,持续维护准确的记忆状态。
记忆治理
更新、冲突消解、删除与遗忘
个性化与关怀
偏好、背景、健康与心理关怀
安全执行
把记忆用于任务,同时守住事实、规则与隐私边界。
规则与流程执行
领域推理、程序执行与格式约束
认识论安全与隐私
稳健拒答、最小披露与证据边界
代码赛道共包括 300 个评测实例
覆盖 2 类数据类型
评测数据规模共近 1.8B Tokens
软件工程能力与抗噪记忆
150 个基础任务覆盖缺陷修复与功能增强,并在四档噪声强度下考察历史经验筛选和复用能力。
缺陷修复
代码定位、根因分析、修复实现与回归验证
功能增强
需求理解、接口设计、功能实现与测试适配
噪声干扰等级
低、中低、中高与高干扰,覆盖全部 150 题
多模态赛道共包括近 5000 个评测实例
覆盖 7 个数据来源
评测数据规模共近 800M Tokens
三组集成能力
官网以三组能力呈现,底层仍保留 6 个能力类别与 14 个实际子能力。
记忆认知
检索、视觉推理与关系推理
记忆演化
时间推理、知识更新与持续学习
记忆对齐
个性化、拒答与证据治理
原图优先,caption 兼容
平台发送原图及 caption;支持图片的系统处理原图,文本系统可忽略 image_url 并使用 caption。
多模态写入
按有序内容数组接收文本和 Base64 图片
跨模态检索
返回与问题相关的文字或图片证据
证据作答
平台保留图片内容并进入统一 Answer 链路
参赛组别
开源方法与商业产品,
分别进入对应榜单。
让方法被准确复现,
也被公平看见。
面向论文方法、研究项目与开源框架。第二期同样要求参赛方自行部署 Add / Search API;开源仓库用于方法披露和版本核验,不能替代在线接口。
- 提交
- Add / Search API
GitHub 仓库与固定 Commit - 复核
- API 过程日志 · Commit 固定
配置与版本审计 - 展示
- 方法 · 论文 · 仓库
配置与复现状态 - 激励
- 符合规则可参与
开源方法榜奖励
让产品能力脱离宣传,
回到统一证据。
面向商业 API、闭源产品与企业系统。无需公开源码,但必须提交可核验的产品和 API 版本。
- 提交
- Add / Search API
产品与版本材料 - 复核
- API 日志 · 版本声明
接口一致性核验 - 展示
- 产品名称 · 版本
统一评测成绩 - 激励
- 独立商业产品榜
不参与奖金评选
层级说明先选择评测赛道(文本 / 代码 / 多模态),再按参赛主体进入开源方法榜或商业产品榜。两类参赛者都必须自行部署 Add / Search API;同一赛道内统一数据、模型、资源限制与评分流程。
报名与评测开放
00:00 起可提交报名信息、申请评测 Key,并按赛道启动 Smoke 与 Full。
11 月 4 日 23:59 评测停止
复核与正式公榜
完成结果复核后,文本、代码与多模态三个赛道分别发布正式榜单。
* 具体评测安排以赛事官网发布的最新通知为准。
协议固定
数据版本、接口、并发、超时、重试、Answer 与 Eval 配置在同一期保持一致。
私有评测
公开数据支持预检与复现;私有数据不开放,降低定向过拟合。
版本追溯
成绩绑定 Commit、镜像或 API 版本,以及 Run、Suite 与 Pipeline 标识。
异常复核
硬编码、提示词注入、人工干预、复现不一致与恶意刷榜均按规则处理。
共同完善 Agent Memory
评测基准与公开契约
欢迎提交来源明确、难度适当、具有补充价值且可复核的 Benchmark、测试场景、数据或评测维度建议。
提交系统
自行部署并提交稳定的 Add / Search API,写清版本、鉴权与容量。
通过 Smoke
验证接口、鉴权与端到端链路。
启动 Full
按赛道独立受理;受理后冻结该赛道版本与评测合同。
复核上榜
有效结果完成复核后公开发布。
参赛问答
常见问题
操作细节以 API 指南、参赛说明和当期规则为准。
01参赛是否收费?
不收费。平台承担统一 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本。
02我要怎么参与?
选择文本、代码或多模态赛道及参赛组别,自行部署稳定的 Add / Search API,在 Evaluation 页面申请并绑定评测 Key;对应赛道 Smoke 通过后即可启动 Full。
03是否必须开源?
开源方法榜需提供可公开核验的 GitHub 仓库和固定 Commit,但第二期不再接受仅提交仓库后由平台代部署;开源与商业参赛者都必须提供自行部署的 Add / Search API。商业产品榜无需公开内部实现。
04正式评测能提交几次?
本届比赛每个 AML Key 在每个赛道最多提交 2 次 Full;各赛道额度独立。第 2 次须在首次 Full 运行完成满 30 天后发起。失败或取消的任务通过断点续跑恢复,不计为一次新的 Full。
05学术榜可以使用哪些模型?自训练模型如何参赛?
学术榜的 Embedding 模型须使用 text-embedding-v4,LLM 相关组件须使用 gpt-4o-mini;Reranker 不作限制。使用自训练模型或其他开放权重模型的系统,建议参加工业榜。工业榜不要求商业化,非商业开源项目也可参赛。
06什么是有效提交?
材料完整、Smoke 通过、Full 完成,并通过版本、结果与合规复核的提交才计为有效提交。
07评测失败或结果有争议怎么办?
Smoke 阶段可按错误信息修正。Full 若出现平台异常或结果争议,可提交 Run / Job ID 与脱敏说明进入复核。
08申请后多久可以拿到评测 Key?
评测 Key 将在申请次日北京时间 19:00 前发放。
Agent Memory Challenge
忆决高下
赛事官方公众号欢迎关注!
