GEOZ
让优质内容被 AI 引用
首页
GEO 分析工具
GEO 问答
GEO
AI大模型
DeepSeek
llms.txt
schema
RSS
菜单
Entity
DPO
Direct Preference Optimization,直接偏好优化,无需奖励模型,直接用偏好对更新策略,比RLHF更简单高效。
相关文章
适合想了解大模型从零训练全流程的工程师