Research Mainline

Agentic RL 的可学习环境演进

核心问题
Agentic RL 的环境供给如何从可执行沙箱发展到可训练、可校准的环境模型,各类方案分别替代真实交互的哪一部分?
边界
环境供给为何成为训练约束 Agent 在数学推理任务中可能只需要答案验证器。进入浏览器、代码仓库和业务工具后,一次 rollout 同时依赖文件系统、数据库、依赖、权限、用户回复、网络内容和终态检查。训练成本由任务数、每个任务的采样数、轨迹长度、复位成本和环境响应成本共同决定。策略持续更新还会改变访问的状态分布,使固定离线轨迹很快偏离当前策略。 本文所说的“可学习环境”包含两层含义。外部 learned environment 直接近似动作后的观测、奖励或终止信号;内部 world model 学习动作后果,用于...
分类框架
环境角色 × 状态权威 × 转移权威 × 奖励权威 × 真实数据校准闭环
当前判断
当前更稳健的训练架构由四个参数生命周期相互独立的部分组成:策略负责动作;环境模型从真实 transition 学习并在一个策略更新窗口内冻结;验证器优先使用测试、规则或数据库差分;风险门控根据不确定性、状态新颖度、动作权限和奖励重要性选择模拟或真实执行。真实抽检结果进入 replay 刷新和环境模型重校准。 环境模型的主要价值是把昂贵真实交互前置并摊薄到更多后续 rollout,同时提供可复制的课程和失败分支。真实环境继续承担三个职责:提供 canonical state,发现新策略进入的分布外区域,完成高价值动作和最终验收。模型规模提升有助于局部模拟质量,无法单独解决奖励共同偏差和策略主动利用误差的问题。 内部化路线适合把后果预...

Research Mainline

LLM 与 Agent 强化学习中的信用分配

核心问题
稀疏终局奖励如何被分配到 LLM 与 Agent 轨迹中的 token、步骤、工具调用、记忆操作、摘要、角色和策略,各方法依赖什么可比性与额外模型?
边界
稀疏回报为何在 Agent 轨迹中更难分配 LLM 轨迹的 token 数很长,Agent 轨迹还包含工具返回、环境状态、记忆写入、摘要、角色交接和不可训练 observation。终局成功可能依赖早期一个工具选择,也可能来自多个普通步骤的组合。把同一个回报均匀广播会强化成功轨迹中的无效行为,也会惩罚失败轨迹中有价值的局部尝试。 带上下文压缩的 Agent(compact agent)增加了状态分叉。一次摘要或记忆写入改变后续上下文,两个来自同一 prompt 的 rollout 随后可能处于不同有效状态。提示级...
分类框架
信用单元 × 识别信号 × 分配算子 × 可比性条件 × 策略角色配置
当前判断
当前最有解释力的设计空间由“信用单元 × 识别信号 × 分配算子 × 可比性条件 × 策略角色配置”组成。只报告 token/turn 粒度会遗漏状态比较条件和额外模型;只报告 critic 或 judge 会遗漏信用实际落到哪些生成行为。未来方法应把五轴同时写入实验协议。 带上下文压缩的 Agent 适合组合两类信号:来源追踪有向无环图(provenance DAG)决定哪些 token、来源和记忆操作允许接收信用;同状态重采样或压缩状态 critic 决定有符号幅度。这个组合能分开“后续使用了什么”和“替换该行为会怎样”。它仍需递归来源、负向信用、掩码覆盖率与 critic 校准的联合诊断。 多策略路径值得单独研究。多个任务策...

Research Mainline

国产前沿模型技术报告时间线

核心问题
国产前沿模型组织如何在技术报告和官方发布材料中推进基础架构、推理强化学习、长上下文、Agent 系统与训练—服务协同,公开证据的强度如何变化?
边界
时间线比较的对象 本文的比较对象限定为“公开材料中能够复核的技术路线”,组织的全部内部能力在范围外。一个模型版本可能具有很强的产品表现,公开材料只给出模型卡;另一个版本可能公开训练配方和消融。两者在时间线上都可以出现,证据强度必须分开。 技术层级分为五层:基础架构与数据;预训练和低精度系统;推理与强化学习后训练;长上下文、记忆和 Agent 环境;推理服务与生产部署。单个节点可以跨层,例如 DeepSeek V3 同时披露 MoE、FP8、DualPipe 与 MTP,GLM 5.2 同时涉及长上下文、criti...
分类框架
组织路线 × 模型世代 × 技术层级 × 披露深度 × 证据类型
当前判断
阅读国产模型报告时,最有效的入口是“组织路线 × 技术层级 × 披露深度”,榜单只作为单份材料内部的结果证据。DeepSeek 适合追踪基础架构和训练系统的连续演进;Qwen 适合观察模型族、多模态与开放生态;Kimi 适合观察长上下文 RL 和视觉 Agent;MiniMax 适合观察高效注意力与长输出;GLM 适合观察异步 RL、上下文压缩和长程 coding;MiMo 适合观察多教师蒸馏与 Agent 服务协同。 2026 年的共同约束已经从参数规模转向有效训练与执行路径:怎样在长上下文中降低注意力和 KV 成本,怎样让 rollout 与工具环境持续供给可验证经验,怎样限制 reward hacking,怎样把 MTP、稀...