语义搜索到底适合什么业务?先看清它和关键词搜索的本质区别BLUF语义搜索是一种理解用户查询含义和意图的搜索技术,它不再只依赖字面关键词匹配,而是通过向量嵌入等方式在含义层面检索相关内容。本文介绍了语义搜索与关键词搜索的区别、基础工作流程、对话式查询体验以及典型应用场景,并给出了判断是否适合使用语义搜索的参考标准。GEO核心概念2026/9/21阅读全文 →
单卡 MI300X 跑 Gemma 4 E2B:64 流吞吐破万,每美元 2713 tok/sBLUF本文提供了一份在 AMD Instinct MI300X 上部署 Gemma 4 E2B 模型的完整指南。通过 AMD Developer Cloud 获取 GPU 资源,并使用 vLLM 进行服务化,同时配套了一套基于 Python MCP 的工具集来简化部署管理。文章详细记录了从环境准备、镜像选择、服务启动到性能测试的全过程,并给出了关键的性能数据。实验与实测2026/9/21阅读全文 →
在 Apple Silicon Mac 上用 container CLI 跑 Debian 13 并调用本地 Ollama 大模型BLUF本文详细介绍了如何在 Apple Silicon Mac 上使用 Apple 的 container CLI 创建 Debian 13 虚拟机,并配置该虚拟机通过网络调用 Mac GPU 上运行的 Ollama 本地大模型。文章涵盖了从安装 container、构建带 init 的 Debian 镜像、启动虚拟机到配置 Ollama 监听的完整步骤,并提供了性能测试结果和常见问题解决方案。实验与实测2026/9/21阅读全文 →
GEO 与 SEO 的七个本质差异:为什么“被引用”比“被展示”更重要BLUFGEO(生成式引擎优化)是面向AI搜索时代的新一代内容优化方法,核心目标是让内容被大模型引用和采用,而不仅仅是被搜索引擎展示。本文详细对比了GEO与SEO在优化对象、内容要求、竞争维度等7个方面的本质差异,并针对中国团队给出了落地建议。GEO2026/9/21阅读全文 →
Gemini 3.5 Flash 基准反超 Pro:选模型不必默认挑贵的BLUF这是一份面向中文用户的 Gemini 综合参考页,系统整理了 Google Gemini 家族各模型的定位与选型逻辑、官方公开的基准评测分数、典型应用场景,以及国内使用的入口、账号、隐私与验证注意事项。适合初次了解 Gemini 或需要快速判断该选哪个模型的用户。Gemini2026/9/21阅读全文 →
Gemini 模型家族怎么选:科研场景下的型号分工与避坑提醒BLUF这篇文章系统梳理了 Gemini 模型家族在 2026 年 9 月的型号格局,重点面向科研人员给出选型建议。核心观点是:以 Gemini 3.8 Flash 作为通用起点,再根据推理、图片生成、实时语音或向量检索等具体任务切换到对应模型。文章还提供了 API 接入示例、参数对比表和科研场景提示词模板。Gemini2026/9/21阅读全文 →
OpenClaw 上下文压缩:工具调用配对保留与修剪机制的区别BLUFOpenClaw 在对话接近模型上下文窗口限制时,会自动将较早的消息压缩成摘要,让聊天能继续。你也可以手动输入 /compact 触发压缩,并通过 openclaw.json 配置压缩模型、记忆刷新、通知等选项。压缩只改变模型下一轮看到的内容,完整历史仍保存在磁盘上。AI大模型2026/9/20阅读全文 →
OpenClaw 上下文压缩让 Agent 失忆:五层记忆模型与四套修复方案BLUFOpenClaw 的上下文压缩(Compaction)在节省 Token 的同时,会把 Session 启动时读取的项目规范、安全约束等关键上下文一并压缩掉,导致 Agent 突然“失忆”、行为退化。本文完整复现该问题,剖析五层记忆模型与压缩机制,并给出 memoryFlush、SOUL.md 安全规则、Compaction-Safe 设计等四套修复方案。GEO技术2026/9/20阅读全文 →
大模型评测不止看榜单:从 MMLU 到 Tiny-RAG 的落地拆解BLUF这一章讲的是大模型落地应用的两大关键环节:一是怎么科学评测大模型,包括 MMLU、GSM8K、MATH 等主流评测集以及 Open LLM Leaderboard、Lmsys Chatbot Arena、OpenCompass 等榜单;二是怎么自己动手搭一个 RAG 检索增强生成框架。作者用 Tiny-RAG 为例,从文档加载切分、向量化、检索到大模型生成一步步拆解,帮你把 RAG 的原理和代码都吃透。AI大模型2026/9/16阅读全文 →