程序员转大模型:一条从 API 调用到生产级 Agent 的工程路线图BLUFLLM Master 是一个面向程序员的大模型学习路线仓库,按基础认知、应用开发、RAG、Agent、微调部署、Transformer、项目与面试逐级展开。它强调工程落地、问题排查和面试表达,适合有开发基础、想进入大模型应用开发或 Agent 工程的工程师。AI大模型2026/10/5阅读全文 →
置顶GEO 正在改写流量入口:让内容被 AI 选中并引用BLUF生成式AI搜索已占全球搜索市场43%份额,GEO(生成式引擎优化)正成为企业信息触达用户的核心策略。本文系统讲解了GEO的定义、与SEO的本质差异、RAG技术底层、三步实施策略及教育、餐饮等行业的落地案例,帮助技术从业者理解如何让企业内容成为AI生成答案的权威引用源。GEO2026/10/4阅读全文 →
单张 TPU v5e 跑 12B 模型:重打包 Gemma 4 QAT 权重实测BLUF本文提供了一份分步指南,教你如何将 Google 量化感知训练(QAT)的 Gemma 4 权重重新打包,以便在单块 Google Cloud TPU v5e 芯片上通过 vLLM 部署。重打包后的模型在分类、数学、工具调用等任务上表现与 bf16 相当,甚至优于 Google 官方的 4-bit 导出,同时支持从 E2B 到 26B 的所有尺寸。实验与实测2026/10/3阅读全文 →
llms.txt 部署实战:30 分钟给 AI 爬虫画一张重点地图BLUFllms.txt 是一项新兴提案标准,用来告诉大语言模型该优先收录你网站的哪些内容、用什么格式解析。它和 robots.txt 是互补关系:robots.txt 管抓取权限,llms.txt 管内容理解。本文带你通读完整规范、平台支持情况和分步部署流程,30 分钟就能上线一个可用的 llms.txt。llms.txt2026/10/3阅读全文 →
上下文工程不只是提示词:1400篇论文揭示模型理解与生成的不对称BLUF这篇综述论文系统介绍了上下文工程这一新兴学科,它超越了简单的提示设计,涵盖上下文检索、生成、处理和管理等基础组件,并探讨了RAG、记忆系统、工具集成推理和多智能体系统等高级实现。通过对1400多篇论文的分析,作者指出当前模型在理解复杂上下文方面表现出色,但在生成长篇复杂输出方面仍有明显局限。GEO技术2026/10/2阅读全文 →
把嵌入表也压到4位:Gemma 4 E2B 在单张 T4 上显存降到 2.86 GiBBLUF本文提供了一份完整的教程,指导如何将Google的QAT Gemma 4 E2B模型量化为4位权重(包括嵌入表),并在单张Tesla T4上使用vLLM进行服务。结果显示,int4嵌入版本仅占用2.86 GiB显存,支持109.9万token的KV缓存,解码速度达到109.7 tok/s,且输出与bf16版本完全一致。实验与实测2026/10/1阅读全文 →
打断延迟压到毫秒级:用 Gemini Live API 搭建实时语音代理BLUF本文介绍了如何使用 Gemini Live API 构建一个实时语音代理,实现类似真人对话的交互体验。文章对比了传统文本转语音(TTS)与 Gemini Live 的音频到音频模式,并详细讲解了架构设计、核心循环、打断技巧以及工具集成等关键步骤。通过异步确认模式,可以避免工具执行导致的对话停顿。Gemini2026/9/29阅读全文 →
Gemini Workspacer:用对话把想法变成 Google 文档、表格和幻灯片BLUFGemini Workspacer 是一个本地演示应用,能通过聊天规划,自动调用 Gemini CLI 和 Google Workspace 工具,为你生成结构化的 Google 文档、表格和幻灯片。它适合技术开发者快速搭建原型,但仅限本地使用。Gemini2026/9/27阅读全文 →
语义搜索工程实践:混合搜索与查询改写比模型选型更决定成败BLUF语义搜索通过BERT等预训练模型将文本向量化,解决了传统关键词搜索中一词多义、同义不同词和上下文关联三大痛点。本文从系统架构设计、混合搜索策略、上下文感知实现到生产环境问题排查,系统梳理了语义搜索的工程实践要点,并给出了向量数据库选型、效果评估指标和前沿方向探索的具体建议。GEO技术2026/9/26阅读全文 →