让模型自己管上下文:CLM 零样本准确率提升 11.4%,算力反降 21.5%
AIAI Summary (BLUF)
Meta 联合华盛顿大学等机构发布了上下文语言模型(CLM),把上下文当作文件让模型自主增删改,零样本下就能超过现有上下文管理策略,在 BrowseComp-Plus 上准确率提升 11.4% 且 FLOPs 减少 21.5%。项目已开源,支持在 Harbor 任务上直接运行,并提供了上下文学习和强化学习两条优化路径。
核心洞察
这篇论文最让我意外的地方是,让模型自己管理上下文这件事,居然不需要重新训练就能见效。他们拿现有模型直接搭了个CLM,在BrowseComp-Plus一个用于评估上下文管理能力的基准测试任务,CLM 在该任务上零样本准确率提升 11.4%,FLOPs 减少 21.5%。上准确率涨了11.4%,算力反而省了21.5%。不过我也得说,零样本效果好不代表这套方法在所有场景都稳,后面那个强化学习的实验才更能说明问题。
核心结论
上下文语言模型(CLM)将上下文视为可任意修改的文件,让模型原生管理自身上下文,且该机制可扩展到多智能体系统。
零样本搭建的CLM在多项任务上超越现有最佳上下文管理策略:BrowseComp-Plus准确率高出11.4%、算力少用21.5%;EdgeBench一个长达 12 小时的基准测试,CLM 在该任务上分数提升 5%,FLOPs 减少 59%。得分高5%、算力少用59%;24小时多仓库智能体集群任务同等算力下提升65%。
CLM可通过自然语言指令引导,指令由标准技能优化循环演化而来,在上下文管理任务上留出集准确率最多提升35.9个百分点,同时算力下降。
引入在线强化学习后,Qwen3.5-9B一个 90 亿参数的大语言模型,在 CLM 的在线强化学习方法下,于 BrowseComp-Plus 上性能提升 47.6%,FLOPs 减少 12%。在BrowseComp-Plus上表现提升47.6%,算力少用12%。
CLM已支持Pi(
pi install npm:@lolipopshock/pi-clm),代码仓库包含clm_harness、clm_icl、clm_rl及用于高效推理的suffix_cache_reuse,项目采用CC BY-NC 4.0许可。
上下文语言模型:让模型自己管自己的上下文
我们提出了上下文语言模型(Context Language Models,CLMs),这类模型能原生地管理自己的上下文。具体做法是把上下文当成一个文件,允许模型对这个文件做任意修改。这样一来,模型可以自己学出上下文里什么最值得保留,而且这套机制天然就能扩展到多智能体系统,多个智能体的上下文可以像文件一样共存。
- 零样本。 用现有模型零样本搭建的CLM,在多项任务上超过了当前最好的上下文管理策略:BrowseComp-Plus上准确率高出11.4%,算力少用21.5%;12小时的EdgeBench上得分高5%,算力少用59%;24小时多仓库智能体集群任务上,同等算力下提升幅度达到65%。
- 上下文学习。 CLM可以通过自然语言指令来引导,这些指令用标准的技能优化循环演化出来。在一个上下文管理任务上,留出集准确率最多提升了35.9个点,同时算力还降了。
- 强化学习。 我们还给CLM引入了一种在线强化学习方法,Qwen3.5-9B在BrowseComp-Plus上的表现提升了47.6%,算力少用12%。
首日支持
CLM已经支持Pi:
pi install npm:@lolipopshock/pi-clm
快速开始
在任何Harbor一个智能体任务运行框架,CLM 以 clm-minimal 智能体的形式集成其中,可通过 clm-harbor 命令行工具运行。任务上运行最小的CLM智能体:
pip install -e .
clm-harbor run -p <harbor-task> -a clm-minimal -m openai/<model> \
--agent-kwarg api_base=http://localhost:8000/v1
clm-harbor就是Harbor的命令行工具,CLM以-a clm-minimal的形式提供。配置和部署细节见clm/clm_harness。
代码仓库
| 目录 | 说明 |
|---|---|
clm/clm_harness |
在Harbor中实现的CLM |
clm/clm_icl |
CLM的上下文学习 |
clm/clm_rl |
CLM的强化学习 |
suffix_cache_reuse |
用于CLM高效推理的后缀缓存复用 |
即将发布
- ContextBench
引用
如果你觉得我们的工作有帮助,欢迎引用:
@article{shao2026context,
title = {Context Language Models},
author = {Shao, Rulin and Shen, Shannon Zejiang and Yin, Junjie Oscar and Li, Yuetai and
Wang, Minheng and Ivison, Hamish and Poovendran, Radha and Lambert, Nathan and
Xiao, Teng and Lewis, Mike and Yih, Wen-tau and Zettlemoyer, Luke and Koh, Pang Wei},
journal = {arXiv preprint arXiv:2609.37725},
year = {2026}
}
许可
本项目采用CC BY-NC 4.0许可。另见NOTICE文件。
常见问题(FAQ)
上下文语言模型(CLM)和普通大模型有什么区别?
CLM把上下文当成一个文件,让模型自主增删改,从而原生地管理自己的上下文。它无需重新训练,用现有模型零样本搭建即可,还能扩展到多智能体系统,让多个智能体的上下文像文件一样共存。
CLM零样本效果怎么样,能省多少算力?
零样本搭建的CLM在多项任务上超过现有最好的上下文管理策略:BrowseComp-Plus准确率高11.4%、算力少21.5%;EdgeBench得分高5%、算力少59%;多仓库智能体集群任务同等算力下提升达65%。
CLM怎么快速上手,代码在哪?
可先安装Pi支持:pi install npm:@lolipopshock/pi-clm。再运行最小智能体:clm-harbor run -p
版权与免责声明:本文仅用于信息分享与交流,不构成任何形式的法律、投资、医疗或其他专业建议,也不构成对任何结果的承诺或保证。
文中提及的商标、品牌、Logo、产品名称及相关图片/素材,其权利归各自合法权利人所有。本站内容可能基于公开资料整理,亦可能使用 AI 辅助生成或润色;我们尽力确保准确与合规,但不保证完整性、时效性与适用性,请读者自行甄别并以官方信息为准。
若本文内容或素材涉嫌侵权、隐私不当或存在错误,请相关权利人/当事人联系本站,我们将及时核实并采取删除、修正或下架等处理措施。也请勿在评论或联系信息中提交身份证号、手机号、住址等个人敏感信息。


