Research topics
研究主题
42 个细粒度主题按核心贡献组织,同一篇论文可以连接多个直接相关的问题域。
13 routes · 71 notes
Training
模型训练、后训练、优化信号与训练基础设施。
Distributed Training
10训练并行、通信、调度与多设备扩展。
Training Memory
3训练状态、梯度、参数或 activation 的显存管理。
Parameter-Efficient Finetuning
1LoRA 等参数高效微调方法与系统。
Optimizer
3参数更新规则、曲率、缩放与优化器工程。
RL Algorithm
20直接修改 policy objective、advantage 或 trust region 的 RL 方法。
Reasoning RL
24面向数学、代码与长推理能力的强化学习。
Agent RL
22面向多轮环境交互、工具调用与 agent 行为的强化学习。
Credit Assignment
14把 trajectory reward 分配到 step、token、trace 或 agent。
Reward Modeling
16训练或构造 reward、proxy、preference 与可验证信号。
Training Stability
11控制 entropy、分布偏移、数值误差与异步陈旧性。
On-Policy Distillation
9在 student 自生成轨迹上使用 teacher 分布或反馈。
RL Infrastructure
7组织 actor、rollout、reward、trainer 与权重同步的训练系统。
Rollout Optimization
15降低 rollout 等待、生成成本、长尾与采样浪费。
6 routes · 30 notes
Inference
在线推理、请求调度、缓存与 test-time compute。
Inference Scheduling
6请求、prefill、decode 或微任务的执行次序与 batch 构造。
Serving Runtime
9面向在线负载的完整推理 runtime 与执行接口。
KV Cache
9KV 的存储、复用、迁移、抢占与容量管理。
Speculative Decoding
9通过 draft、验证与接受策略减少 target decode 次数。
Test-Time Scaling
10用多轨迹、搜索、验证或聚合扩大推理计算。
Deterministic Inference
2控制 kernel、batch 与浮点路径引入的输出差异。
9 routes · 36 notes
Architecture
模型结构、attention、MoE 与长上下文机制。
Long Context
18扩大训练或推理上下文并控制时间、显存与质量。
Sparse Attention
7只访问被选择的 token、block 或 chunk。
Linear Attention
4用有限状态或核化计算替代完整二次 attention。
Attention Kernel
6attention kernel 的 IO、tiling、并行与硬件映射。
MoE Architecture
11专家划分、路由、共享专家与稀疏激活结构。
MoE Systems
4MoE 训练或推理中的通信、负载均衡与部署。
Multi-Token Prediction
5一次 backbone step 预测多个 token 或 draft。
Memory Architecture
3模型内部的检索记忆、压缩状态或动态记忆结构。
Multimodal Model
2联合文本、图像或视频输入的模型与训练。
5 routes · 27 notes
Agents
Agent 程序、工具、记忆、协作与软件工程。
Agent Workflow
13表达和执行多阶段 agent 数据流与生命周期。
Tool Use
8模型调用 API、搜索、代码环境或计算机工具。
Agent Memory
8Agent 对历史 turn、经验与上下文的选择和重建。
Multi-Agent Orchestration
2多个 agent 或 subagent 的并行、聚合与编排。
Coding Agent
6面向 repository、测试和软件工程任务的 agent。
4 routes · 15 notes
Evaluation
验证器、过程监督、基准与能力边界分析。
Verifier
5对答案、轨迹、行为或候选进行评分与选择。
Process Supervision
3对中间 reasoning step 提供标签、reward 或验证。
Benchmark
7构造或审计用于比较模型和 agent 的评测集合。
Reasoning Analysis
5区分采样、组合、泛化与真实 reasoning 能力变化。
2 routes · 11 notes
Safety
奖励攻击、对齐、监控与高风险行为。
Reward Hacking
8优化 proxy、测试或规则时偏离真实目标。
AI Safety
10模型或 agent 的对齐、风险、欺骗与治理。
3 routes · 16 notes
Theory
学习目标、复杂性与缩放规律的形式化结果。
RL Theory
13RL objective、估计量、方差与性能界。
Formal Expressivity
1模型相对逻辑、自动机或其他计算模型的表达复杂度。
Scaling Laws
2参数、数据、计算和 loss 之间的经验或理论缩放关系。