Create your own

大模型后训练与智能体

统计学习、信息论与优化基础
Transformer 与自回归语言模型
监督微调的数据与训练机制
人类反馈数据与奖励模型
强化学习与策略梯度基础
基于 PPO 的 RLHF 训练
直接偏好优化与 GRPO
后训练评测、数据飞轮与实验设计
训练系统、显存与分布式基础
训练框架定位与源码修改
Agent 后训练与技术判断表达