Create your own

大模型后训练与智能体

统计学习、信息论与优化基础
Transformer 与自回归语言模型
监督微调的数据与训练机制
偏好数据与奖励模型
强化学习与策略梯度基础
基于 PPO 的 RLHF 训练
直接偏好优化与组相对强化学习
后训练评测、数据飞轮与实验设计
训练系统、显存与分布式基础
训练框架定位、并行机制与源码修改
Agent 轨迹后训练与综合技术表达