GEOZ
让优质内容被 AI 引用
首页
最新文章
GEO
AI大模型
DeepSeek
llms.txt
schema
RSS
菜单
Entity
大模型评测
用标准化的方法和数据集对大模型在不同任务上的表现进行量化与比较,覆盖准确性、泛化能力、推理速度和资源消耗等方面。
术语属性
目的:
衡量模型性能与适用性,暴露偏见与鲁棒性问题
相关文章
大模型评测不止看榜单:从 MMLU 到 Tiny-RAG 的落地拆解