13 routes · 71 notes

Training

模型训练、后训练、优化信号与训练基础设施。

Distributed Training

10

训练并行、通信、调度与多设备扩展。

Training Memory

3

训练状态、梯度、参数或 activation 的显存管理。

Parameter-Efficient Finetuning

1

LoRA 等参数高效微调方法与系统。

Optimizer

3

参数更新规则、曲率、缩放与优化器工程。

RL Algorithm

20

直接修改 policy objective、advantage 或 trust region 的 RL 方法。

Reasoning RL

24

面向数学、代码与长推理能力的强化学习。

Agent RL

22

面向多轮环境交互、工具调用与 agent 行为的强化学习。

Credit Assignment

14

把 trajectory reward 分配到 step、token、trace 或 agent。

Reward Modeling

16

训练或构造 reward、proxy、preference 与可验证信号。

Training Stability

11

控制 entropy、分布偏移、数值误差与异步陈旧性。

On-Policy Distillation

9

在 student 自生成轨迹上使用 teacher 分布或反馈。

RL Infrastructure

7

组织 actor、rollout、reward、trainer 与权重同步的训练系统。

Rollout Optimization

15

降低 rollout 等待、生成成本、长尾与采样浪费。

6 routes · 30 notes

Inference

在线推理、请求调度、缓存与 test-time compute。

Inference Scheduling

6

请求、prefill、decode 或微任务的执行次序与 batch 构造。

Serving Runtime

9

面向在线负载的完整推理 runtime 与执行接口。

KV Cache

9

KV 的存储、复用、迁移、抢占与容量管理。

Speculative Decoding

9

通过 draft、验证与接受策略减少 target decode 次数。

Test-Time Scaling

10

用多轨迹、搜索、验证或聚合扩大推理计算。

Deterministic Inference

2

控制 kernel、batch 与浮点路径引入的输出差异。

9 routes · 36 notes

Architecture

模型结构、attention、MoE 与长上下文机制。

Long Context

18

扩大训练或推理上下文并控制时间、显存与质量。

Sparse Attention

7

只访问被选择的 token、block 或 chunk。

Linear Attention

4

用有限状态或核化计算替代完整二次 attention。

Attention Kernel

6

attention kernel 的 IO、tiling、并行与硬件映射。

MoE Architecture

11

专家划分、路由、共享专家与稀疏激活结构。

MoE Systems

4

MoE 训练或推理中的通信、负载均衡与部署。

Multi-Token Prediction

5

一次 backbone step 预测多个 token 或 draft。

Memory Architecture

3

模型内部的检索记忆、压缩状态或动态记忆结构。

Multimodal Model

2

联合文本、图像或视频输入的模型与训练。

5 routes · 27 notes

Agents

Agent 程序、工具、记忆、协作与软件工程。

Agent Workflow

13

表达和执行多阶段 agent 数据流与生命周期。

Tool Use

8

模型调用 API、搜索、代码环境或计算机工具。

Agent Memory

8

Agent 对历史 turn、经验与上下文的选择和重建。

Multi-Agent Orchestration

2

多个 agent 或 subagent 的并行、聚合与编排。

Coding Agent

6

面向 repository、测试和软件工程任务的 agent。

4 routes · 15 notes

Evaluation

验证器、过程监督、基准与能力边界分析。

Verifier

5

对答案、轨迹、行为或候选进行评分与选择。

Process Supervision

3

对中间 reasoning step 提供标签、reward 或验证。

Benchmark

7

构造或审计用于比较模型和 agent 的评测集合。

Reasoning Analysis

5

区分采样、组合、泛化与真实 reasoning 能力变化。

2 routes · 11 notes

Safety

奖励攻击、对齐、监控与高风险行为。

3 routes · 16 notes

Theory

学习目标、复杂性与缩放规律的形式化结果。