llamadart 0.11:让 Flutter 应用真正跑起离线大模型BLUFllamadart 0.11 版本简化了在 Dart/Flutter 应用中集成离线大语言模型的流程。本文通过一个写作助手示例,演示如何下载模型、管理对话会话、切换模型以及处理不同运行时环境,帮助开发者快速实现本地推理功能。GEO技术2026/10/9阅读全文 →
MI300X 上跑 Gemma 4 E2B:fp8 最快,却离原始权重最远BLUF本文提供了在单张AMD Instinct MI300X上通过vLLM部署Gemma 4 E2B十种权重格式的逐步指南,并在相同请求数和提示长度下进行了性能测试。结果显示,fp8格式速度最接近bf16,而int8和4位格式较慢。所有日志、报告和脚本均已开源。实验与实测2026/10/9阅读全文 →
开源向量模型反超商业API:MTEB榜单背后的RAG选型逻辑BLUF这篇文章系统讲解了Embedding模型的工作原理,盘点了2026年MTEB排行榜上的主流文本向量化模型,并针对RAG应用给出了详细的选型建议。无论你是做中文知识库还是多语言检索,都能从中找到适合自己场景的模型方案。GEO技术2026/10/7阅读全文 →
AI 工具怎么选:ChatGPT、Gemini、Kimi、豆包、DeepSeek 按场景拆解BLUF这是一篇AI工具专题的总览页,把ChatGPT、Gemini、Kimi、豆包、DeepSeek等主流AI工具按「懂概念→选模型→按场景用→上平台」重新组织。文章覆盖了工具选型、国内访问方案、写作/画图/PPT/编程等场景推荐,以及提示词入门和合规提示。适合想系统了解AI工具全貌、快速找到对应教程的技术读者。AI大模型2026/10/4阅读全文 →
4GB 显存跑 Gemma 4:重打包 QAT 权重让解码快 1.12 倍BLUF本文手把手教你在只有4GB显存的笔记本GPU(GTX 1650 Ti)上,用重打包的QAT量化GGUF文件运行Gemma 4 E2B模型。通过llama.cpp和CUDA,模型仅占1.2GB显存,解码速度达76 token/秒,比官方GGUF快1.12倍,且完全本地运行,无需云端。实验与实测2026/10/3阅读全文 →
单张 TPU v5e 跑 12B 模型:重打包 Gemma 4 QAT 权重实测BLUF本文提供了一份分步指南,教你如何将 Google 量化感知训练(QAT)的 Gemma 4 权重重新打包,以便在单块 Google Cloud TPU v5e 芯片上通过 vLLM 部署。重打包后的模型在分类、数学、工具调用等任务上表现与 bf16 相当,甚至优于 Google 官方的 4-bit 导出,同时支持从 E2B 到 26B 的所有尺寸。实验与实测2026/10/3阅读全文 →
把嵌入表也压到4位:Gemma 4 E2B 在单张 T4 上显存降到 2.86 GiBBLUF本文提供了一份完整的教程,指导如何将Google的QAT Gemma 4 E2B模型量化为4位权重(包括嵌入表),并在单张Tesla T4上使用vLLM进行服务。结果显示,int4嵌入版本仅占用2.86 GiB显存,支持109.9万token的KV缓存,解码速度达到109.7 tok/s,且输出与bf16版本完全一致。实验与实测2026/10/1阅读全文 →
置顶把 Gemma 4 塞进 T4 小实例:单请求只慢两成,并发一上来性价比就翻车BLUF本文是系列教程的第四部分,指导如何在 Amazon SageMaker 最小的 GPU 实例(NVIDIA T4)上部署 Gemma 4 模型。通过打补丁解决 Turing 架构的共享内存限制,并使用 MCP 工具简化 vLLM 部署管理。实测显示 T4 的解码速度是 L4 的 0.77 到 0.82 倍,但答案完全一致,且 12B 是能容纳的最大版本。实验与实测2026/10/1阅读全文 →
开发者冒充者综合征的真正根源,以及提示注入为何像 SQL 注入BLUF这是 DEV 社区编辑团队每周精选的 Top 7 文章汇总,涵盖用 Next.js 和 Three.js 重建 3D 版 DEV、开发者冒名顶替综合征的真实根源、基于 audio.cpp 的自托管音乐工作室 Miso、好注释的四种类型、WebMCP 与 AI CEO 模拟器、前端架构的统一模型,以及提示注入与 SQL 注入的对比。适合想快速了解海外开发者社区热点话题的技术人阅读。AI 搜索观察2026/9/30阅读全文 →