GEOZ
专注GEO生成式引擎优化、知识库,覆盖AI技术、搜索可见性、结构化数据与内容优化实践。
首页
最新文章
RSS
菜单
Entity
RLHF/DPO/GRPO
先进的大模型训练算法:RLHF(人类反馈强化学习)、DPO(直接偏好优化)、GRPO(群体强化学习优化),用于模型后训练阶段。
相关文章
阿里云AI全栈架构2024指南:从基础设施到通义大模型创新