
大模型评测不止看榜单:从 MMLU 到 Tiny-RAG 的落地拆解
BLUF
这一章讲的是大模型落地应用的两大关键环节:一是怎么科学评测大模型,包括 MMLU、GSM8K、MATH 等主流评测集以及 Open LLM Leaderboard、Lmsys Chatbot Arena、OpenCompass 等榜单;二是怎么自己动手搭一个 RAG 检索增强生成框架。作者用 Tiny-RAG 为例,从文档加载切分、向量化、检索到大模型生成一步步拆解,帮你把 RAG 的原理和代码都吃透。AI大模型2026/9/16







