LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts
LatentMoE 将路由专家移到低维潜空间,并把节省的权重读取与通信预算用于增加专家数和 Top k;准确率优先变体在相近参数的 95B Transformer 与 73B Mamba–Attention 设置中,全部已报下游指标均高于标准 MoE,但万亿参数服务优势仍是模拟结果。
papers.chlience.com
面向训练、推理、架构、Agent、评测、安全与理论的论文阅读档案。每篇笔记保留来源、作者关系、证据边界、局限,以及它和其它论文的连接。
每篇笔记都把论文主张、本地判断和后续讨论分开记录。
跨材料问题的长期分析入口。每条主线保留自己的检索窗口、分类框架和逐结论证据强度。
Agentic RL 的环境供给如何从可执行沙箱发展到可训练、可校准的环境模型,各类方案分别替代真实交互的哪一部分?
稀疏终局奖励如何被分配到 LLM 与 Agent 轨迹中的 token、步骤、工具调用、记忆操作、摘要、角色和策略,各方法依赖什么可比性与额外模型?
国产前沿模型组织如何在技术报告和官方发布材料中推进基础架构、推理强化学习、长上下文、Agent 系统与训练—服务协同,公开证据的强度如何变化?
置顶条目优先,其余按审阅时间列出最近完成本地审阅的论文和技术文章。
LatentMoE 将路由专家移到低维潜空间,并把节省的权重读取与通信预算用于增加专家数和 Top k;准确率优先变体在相近参数的 95B Transformer 与 73B Mamba–Attention 设置中,全部已报下游指标均高于标准 MoE,但万亿参数服务优势仍是模拟结果。
LRE 用日志中的未来复用信号训练轻量逻辑回归,对历史单元做查询无关打分并按预算逐字保留;单随机种子 AppWorld 中以零压缩器调用得到 41.1% 任务目标完成率、接近全历史的 44.0%,LoCoMo 上也是最佳受预算策略,但 Hard 与 LongMemEval 结果显示它尚未跨域占优,2048 token 只约束较旧历史。
EcoSpec 用轻量路由预测器估计草稿候选会新增的专家集合,并优先选择复用已有专家的验证路径;在八张 H200、Hugging Face Transformers、主要批量为一的研究原型中,三个大规模 MoE 的贪心解码平均加速从对应投机基线相对自回归的一点一零至一点二二倍提高到一点一五至一点三六倍,HBM 流量来自估算且批量为八时投机吞吐低于自回归。
在单步解码已使专家加载趋于饱和、模型仍受内存带宽限制的中等批量区间,用投机验证复用已加载专家;Qwen2 57B A14B 在两张 H800 上最高加速 2.29 倍,适用范围依赖路由均衡、MoE 前馈网络成本占比和具体硬件。
SDPO 在学生在线轨迹上用环境反馈条件化的 EMA 同模型重算下一词分布,将 Top K 分布差转成 logit 级信用;Qwen3 8B 在 LiveCodeBench v6 上达到 48.8%,高于强 GRPO 的 41.2%,但依赖模型回溯能力与反馈质量。
让 student 在自身轨迹上接受 query specific demonstration conditioned EMA 同模型的 token distribution,在提升新任务准确率时显著减少旧能力遗忘。
OPSD 让学生先在只看题目时采样自身轨迹,再用固定初始模型在参考解答上下文中对相同前缀给出的完整词表分布和逐词表项裁剪前向 KL 更新学生,在 Qwen3 1.7B/4B/8B 的三项数学平均分上高于基础模型、SFT 与 GRPO,但总计算、统计方差和领域外泛化仍未对齐。
Kimi K3 将三层 KDA 与一层全局注意力交错、跨块 Attention Residuals 和每个 token 激活 16 个路由专家的 Stable LatentMoE 组合为 2.78 万亿总参数、1042 亿激活参数、百万 token 上下文的原生多模态模型;报告的缩放律拟合把架构、数据与训练配方的合并收益估计为相对 Kimi K2 约 2.5 倍,尚未拆分单个组件贡献。
主题入口用于快速进入同一问题域,数量来自当前归档。