GEOZ
让优质内容被 AI 引用
首页
最新文章
GEO
AI大模型
DeepSeek
llms.txt
schema
RSS
菜单
Entity
DPO(Direct Preference Optimization)
直接偏好优化算法,用于根据人类偏好数据微调语言模型,无需显式的奖励模型训练。
相关文章
Unsloth如何加速LLM微调?2026年开源框架效率提升指南