llamadart 0.11:让 Flutter 应用真正跑起离线大模型BLUFllamadart 0.11 版本简化了在 Dart/Flutter 应用中集成离线大语言模型的流程。本文通过一个写作助手示例,演示如何下载模型、管理对话会话、切换模型以及处理不同运行时环境,帮助开发者快速实现本地推理功能。GEO技术2026/10/9阅读全文 →
MI300X 上跑 Gemma 4 E2B:fp8 最快,却离原始权重最远BLUF本文提供了在单张AMD Instinct MI300X上通过vLLM部署Gemma 4 E2B十种权重格式的逐步指南,并在相同请求数和提示长度下进行了性能测试。结果显示,fp8格式速度最接近bf16,而int8和4位格式较慢。所有日志、报告和脚本均已开源。实验与实测2026/10/9阅读全文 →
从Word2Vec到GPT-3:Embedding如何成为大模型的翻译官BLUFEmbedding是将文本、图像等数据转换为语义向量的核心技术,经历了从Word2Vec到BERT、GPT的动态嵌入演进,并扩展至多模态。本文系统介绍了Embedding的概念、发展历程、常见模型及实际应用示例,帮助读者深入理解大模型处理流程中的关键环节。AI大模型2026/10/8阅读全文 →
开源向量模型反超商业API:MTEB榜单背后的RAG选型逻辑BLUF这篇文章系统讲解了Embedding模型的工作原理,盘点了2026年MTEB排行榜上的主流文本向量化模型,并针对RAG应用给出了详细的选型建议。无论你是做中文知识库还是多语言检索,都能从中找到适合自己场景的模型方案。GEO技术2026/10/7阅读全文 →
把生成式 AI 塞进数据库:AlloyDB 语义搜索与自然语言生成 SQL 实测BLUF本文介绍了如何利用Google Cloud数据库(如AlloyDB和Cloud SQL)的AI集成功能,通过动手实验展示语义搜索、多模态嵌入、AI函数和自然语言生成SQL等应用,帮助开发者将数据与生成式AI模型结合,构建生产级AI应用。实验与实测2026/10/7阅读全文 →
AGI 这个词比深度学习早出现了十年,为什么直到 GPT-4 才被认真讨论BLUF这篇文章用通俗的语言解释了AI、AGI、LLM、GenAI、GPT和AIGC这几个容易混淆的概念,并回顾了从1943年人工神经元到GPT-4的AI发展历程。简单来说,AI是总称,AGI是强人工智能,LLM是大语言模型,GenAI是生成式AI,GPT是LLM的一种,ChatGPT是GPT的聊天工具,AIGC是GenAI生成的内容。AI大模型2026/10/5阅读全文 →
程序员转大模型:一条从 API 调用到生产级 Agent 的工程路线图BLUFLLM Master 是一个面向程序员的大模型学习路线仓库,按基础认知、应用开发、RAG、Agent、微调部署、Transformer、项目与面试逐级展开。它强调工程落地、问题排查和面试表达,适合有开发基础、想进入大模型应用开发或 Agent 工程的工程师。AI大模型2026/10/5阅读全文 →
AI 工具怎么选:ChatGPT、Gemini、Kimi、豆包、DeepSeek 按场景拆解BLUF这是一篇AI工具专题的总览页,把ChatGPT、Gemini、Kimi、豆包、DeepSeek等主流AI工具按「懂概念→选模型→按场景用→上平台」重新组织。文章覆盖了工具选型、国内访问方案、写作/画图/PPT/编程等场景推荐,以及提示词入门和合规提示。适合想系统了解AI工具全貌、快速找到对应教程的技术读者。AI大模型2026/10/4阅读全文 →
置顶把 Gemma 4 塞进 T4 小实例:单请求只慢两成,并发一上来性价比就翻车BLUF本文是系列教程的第四部分,指导如何在 Amazon SageMaker 最小的 GPU 实例(NVIDIA T4)上部署 Gemma 4 模型。通过打补丁解决 Turing 架构的共享内存限制,并使用 MCP 工具简化 vLLM 部署管理。实测显示 T4 的解码速度是 L4 的 0.77 到 0.82 倍,但答案完全一致,且 12B 是能容纳的最大版本。实验与实测2026/10/1阅读全文 →