GEOZ
让优质内容被 AI 引用
首页
最新文章
GEO
AI大模型
DeepSeek
llms.txt
schema
RSS
菜单
Entity
ARC Challenge
评测模型科学推理能力的数据集,重点考察常识性与科学性问题的解答,典型场景是科学考试题和百科问答。
术语属性
类型:
推理评测集
相关文章
大模型评测不止看榜单:从 MMLU 到 Tiny-RAG 的落地拆解