SECOND PUBLIC CYCLE2026 · 09.20 OPEN

Agent 记忆
挑战赛

在统一、可复核的评测环境中,比较 Agent Memory 系统的长期记忆能力,“忆”决高下。

第二届 Agent Memory Challenge 由中国图像图形学会(CSIG)主办,依托 Agent Memory Leaderboard 统一评测平台开展。

第二期开放
09.20 · 00:00
UTC+8
三赛道奖金池
¥150,000
仅面向开源方法榜

组织机构

主办:中国图像图形学会(CSIG)

承办:南京大学、浙江大学、Datawhale、CSIG 企业联络与标准化工作委员会

统一评测平台:Agent Memory Leaderboard(AML)

01 / 统一评测契约02 / 公开与私有数据03 / 平台统一跑测04 / 结果独立复核05 / 版本全程可追溯
01WHY THIS CHALLENGE

统一评测

让不同记忆系统,
在同一套规则下公平比较。

不同论文和产品常使用不同数据集、回答模型和评分模型,成绩难以横向比较。本赛事统一数据、接口、Answer 与 Eval,让参赛系统在同一套评测规则下比较长期记忆能力。

Same data同一批记忆与问题

公开子集用于预检与复现,私有数据降低过拟合。

Same answer同一回答模型

检索结果进入一致的 Answer 合约,隔离生成差异。

Same judge同一评分流程

统一提示词、参数与评分器,保留审计证据。

统一评测协议

系统只负责记忆。
其他变量,交给平台。

清晰的责任边界,是成绩可比的前提。参赛方实现记忆写入与检索;平台统一完成回答与评分。

参赛系统CANDIDATE SYSTEM
  1. 01WRITE

    Add

    接收记忆并完成内部处理

  2. 02RETRIEVE

    Search

    返回相关记录或证据

  3. 03GENERATE

    Answer

    平台统一生成最终答案

  4. 04SCORE

    Eval

    平台统一评分与复核

赛事平台OFFICIAL PLATFORM
不得在 Search 中直接生成最终答案 不得针对公开题目硬编码或跨样本共享状态 必须绑定 Add / Search API、接口配置与系统版本
02BENCHMARK SCOPE

评测类型

文本、代码与多模态,
三赛道独立评测与排名。

三个赛道共用 Add / Search 接入方式和平台任务流程,但分别冻结数据、执行器与评分合同;各赛道的 Smoke、Full 和结果互不占用。

6,000+EVALUATION INSTANCES

文本赛道共包括 6000 余个评测实例

32DATA SOURCES

覆盖 32 个数据来源

≈300MTOKENS

评测数据规模共近 300M Tokens

MEMORY COMPETENCY MODEL证据如何成为可靠行动
  1. 01 找回
  2. 02 记准
  3. 03 用稳
01
RECALL

召回证据

从长期上下文中找到正确、完整且可追溯的信息。

A

显式事实召回

事实、属性、来源与实体信息

B

关系与多跳组合

跨片段证据与关系链恢复

C

时间与事件序列

日期、间隔、顺序与轨迹变化

02
ADAPT

形成稳定记忆

面对变化与个体差异,持续维护准确的记忆状态。

D

记忆治理

更新、冲突消解、删除与遗忘

E

个性化与关怀

偏好、背景、健康与心理关怀

03
ACT

安全执行

把记忆用于任务,同时守住事实、规则与隐私边界。

G

规则与流程执行

领域推理、程序执行与格式约束

H

认识论安全与隐私

稳健拒答、最小披露与证据边界

03TWO DIVISIONS

参赛组别

开源方法与商业产品,
分别进入对应榜单。

FOR OPEN RESEARCH

让方法被准确复现,
也被公平看见。

面向论文方法、研究项目与开源框架。第二期同样要求参赛方自行部署 Add / Search API;开源仓库用于方法披露和版本核验,不能替代在线接口。

提交
Add / Search API
GitHub 仓库与固定 Commit
复核
API 过程日志 · Commit 固定
配置与版本审计
展示
方法 · 论文 · 仓库
配置与复现状态
激励
符合规则可参与
开源方法榜奖励
提交评测申请 →

层级说明先选择评测赛道(文本 / 代码 / 多模态),再按参赛主体进入开源方法榜或商业产品榜。两类参赛者都必须自行部署 Add / Search API;同一赛道内统一数据、模型、资源限制与评分流程。

04PROCESS & TRUST

第二期赛程

从提交到公榜,
每一步都有证据。

平台统一跑测,结果通过版本、日志与合规复核后再进入公开榜单。

查看参赛说明 ↗
EVALUATION ACCESS OPENS

报名与评测开放

00:00 起可提交报名信息、申请评测 Key,并按赛道启动 Smoke 与 Full。

DEADLINES10.31 / 11.0410 月 31 日 23:59 材料截止
11 月 4 日 23:59 评测停止
OFFICIAL LEADERBOARD

复核与正式公榜

完成结果复核后,文本、代码与多模态三个赛道分别发布正式榜单。

* 具体评测安排以赛事官网发布的最新通知为准。

01

协议固定

数据版本、接口、并发、超时、重试、Answer 与 Eval 配置在同一期保持一致。

02

私有评测

公开数据支持预检与复现;私有数据不开放,降低定向过拟合。

03

版本追溯

成绩绑定 Commit、镜像或 API 版本,以及 Run、Suite 与 Pipeline 标识。

04

异常复核

硬编码、提示词注入、人工干预、复现不一致与恶意刷榜均按规则处理。

01 / 第二届赛事奖金OPEN METHOD PRIZE POOL
三个赛道合计奖金¥150K
FIRST PRIZE一等奖 1 名 · ¥20,000SECOND PRIZE二等奖 2 名 · 每名 ¥8,000THIRD PRIZE三等奖 3 名 · 每名 ¥3,000TECHNICAL INNOVATION最佳技术创新奖 1 名 · ¥5,000
每个赛道奖金合计 50,000 元;奖金仅面向开源方法榜,商业产品榜不参与奖金评选。
02 / 基准贡献BENCHMARK CONTRIBUTION
OPEN CALL

共同完善 Agent Memory
评测基准与公开契约

欢迎提交来源明确、难度适当、具有补充价值且可复核的 Benchmark、测试场景、数据或评测维度建议。

贡献内容须满足来源与许可证清晰不含私有评测轨迹不含凭据与商业内部信息可通过官网「基准贡献」模块或咨询邮箱联系赛事团队。
01

提交系统

自行部署并提交稳定的 Add / Search API,写清版本、鉴权与容量。

→
02

通过 Smoke

验证接口、鉴权与端到端链路。

→
03

启动 Full

按赛道独立受理;受理后冻结该赛道版本与评测合同。

→
04

复核上榜

有效结果完成复核后公开发布。

提交评测申请 ↗
05BEFORE YOU ENTER

参赛问答

常见问题

操作细节以 API 指南、参赛说明和当期规则为准。

01参赛是否收费?

不收费。平台承担统一 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本。

02我要怎么参与?

选择文本、代码或多模态赛道及参赛组别,自行部署稳定的 Add / Search API,在 Evaluation 页面申请并绑定评测 Key;对应赛道 Smoke 通过后即可启动 Full。

03是否必须开源?

开源方法榜需提供可公开核验的 GitHub 仓库和固定 Commit,但第二期不再接受仅提交仓库后由平台代部署;开源与商业参赛者都必须提供自行部署的 Add / Search API。商业产品榜无需公开内部实现。

04正式评测能提交几次?

本届比赛每个 AML Key 在每个赛道最多提交 2 次 Full;各赛道额度独立。第 2 次须在首次 Full 运行完成满 30 天后发起。失败或取消的任务通过断点续跑恢复,不计为一次新的 Full。

05学术榜可以使用哪些模型?自训练模型如何参赛?

学术榜的 Embedding 模型须使用 text-embedding-v4,LLM 相关组件须使用 gpt-4o-mini;Reranker 不作限制。使用自训练模型或其他开放权重模型的系统,建议参加工业榜。工业榜不要求商业化,非商业开源项目也可参赛。

06什么是有效提交?

材料完整、Smoke 通过、Full 完成,并通过版本、结果与合规复核的提交才计为有效提交。

07评测失败或结果有争议怎么办?

Smoke 阶段可按错误信息修正。Full 若出现平台异常或结果争议,可提交 Run / Job ID 与脱敏说明进入复核。

08申请后多久可以拿到评测 Key?

评测 Key 将在申请次日北京时间 19:00 前发放。

ENTER THE CHALLENGE · 2026

Agent Memory Challenge
忆决高下

赛事官方公众号二维码

赛事官方公众号欢迎关注!