4GB 显存跑 Gemma 4:重打包 QAT 权重让解码快 1.12 倍BLUF本文手把手教你在只有4GB显存的笔记本GPU(GTX 1650 Ti)上,用重打包的QAT量化GGUF文件运行Gemma 4 E2B模型。通过llama.cpp和CUDA,模型仅占1.2GB显存,解码速度达76 token/秒,比官方GGUF快1.12倍,且完全本地运行,无需云端。实验与实测2026/10/3阅读全文 →
单张 TPU v5e 跑 12B 模型:重打包 Gemma 4 QAT 权重实测BLUF本文提供了一份分步指南,教你如何将 Google 量化感知训练(QAT)的 Gemma 4 权重重新打包,以便在单块 Google Cloud TPU v5e 芯片上通过 vLLM 部署。重打包后的模型在分类、数学、工具调用等任务上表现与 bf16 相当,甚至优于 Google 官方的 4-bit 导出,同时支持从 E2B 到 26B 的所有尺寸。实验与实测2026/10/3阅读全文 →
把嵌入表也压到4位:Gemma 4 E2B 在单张 T4 上显存降到 2.86 GiBBLUF本文提供了一份完整的教程,指导如何将Google的QAT Gemma 4 E2B模型量化为4位权重(包括嵌入表),并在单张Tesla T4上使用vLLM进行服务。结果显示,int4嵌入版本仅占用2.86 GiB显存,支持109.9万token的KV缓存,解码速度达到109.7 tok/s,且输出与bf16版本完全一致。实验与实测2026/10/1阅读全文 →
把 Gemma 4 塞进 T4 小实例:单请求只慢两成,并发一上来性价比就翻车BLUF本文是系列教程的第四部分,指导如何在 Amazon SageMaker 最小的 GPU 实例(NVIDIA T4)上部署 Gemma 4 模型。通过打补丁解决 Turing 架构的共享内存限制,并使用 MCP 工具简化 vLLM 部署管理。实测显示 T4 的解码速度是 L4 的 0.77 到 0.82 倍,但答案完全一致,且 12B 是能容纳的最大版本。实验与实测2026/10/1阅读全文 →
10款大模型计数能力实测:让模型自己数330个ID,最贵的Claude Opus 5只对了9次BLUF这篇基准测试对比了10款大模型在工具调用场景下的计数能力。当工具直接返回精确计数时,几乎所有模型都能正确回答;但当工具返回ID列表需要模型自己数时,模型表现出现严重分化:愿意花更多token推理的模型计数准确,而快速回答的模型错误率极高。结论是:把计数逻辑放在工具端,而不是让模型自己数。实验与实测2026/9/29阅读全文 →
TPU v6e 跑 Gemma 4 决策推理:比 L4 快一倍,成本却贵 3.7 倍BLUF本文手把手教你在单颗 Google Cloud TPU v6e 芯片上,用 vLLM 部署 Gemma 4 系列模型,并运行 Jev 风格的决策模型。文章对比了 TPU v6e 与 NVIDIA L4 GPU 的推理表现,发现 26B-A4B 模型在 TPU 上决策延迟为 27-33 毫秒,远快于 L4 的 61 毫秒,但按需计费成本更高,推荐使用 12B 模型。实验与实测2026/9/25阅读全文 →
一万个网站的 robots.txt 暴露了一个盲区:大家都在封训练爬虫,却忘了答案爬虫BLUFCloudflare推出按答案付费,但网站robots.txt规则大多只屏蔽训练爬虫,忽略了答案爬虫。对1万个网站的分析显示,38%的GPTBot规则写于2023年第四季度,而答案爬虫规则增长缓慢。网站需要更新规则以应对AI答案时代。实验与实测2026/9/22阅读全文 →
一个环境变量切换六个 Iceberg 目录:MCP 服务器实测与踩坑记录BLUF本文提供了一个逐步指南,教你如何设置一个 MCP 服务器来连接 Apache Iceberg 表,并依次测试七种 Iceberg REST 目录。服务器提供四个只读工具,通过一个环境变量决定读取哪个目录。实验与实测2026/9/22阅读全文 →
RTX 3090 跑大模型实测:24GB 显存能撑到哪一步BLUFRTX 3090 拥有 24GB GDDR6X 显存和 936 GB/s 带宽,目前闲鱼中位价约 8350 元。在 Q4 量化下,它最高能跑 32B 参数模型,预估速度 33 tokens/s。本文整理了完整规格、2026 年新模型的兼容性测试以及多平台价格参考。实验与实测2026/9/21阅读全文 →
单卡 MI300X 跑 Gemma 4 E2B:64 流吞吐破万,每美元 2713 tok/sBLUF本文提供了一份在 AMD Instinct MI300X 上部署 Gemma 4 E2B 模型的完整指南。通过 AMD Developer Cloud 获取 GPU 资源,并使用 vLLM 进行服务化,同时配套了一套基于 Python MCP 的工具集来简化部署管理。文章详细记录了从环境准备、镜像选择、服务启动到性能测试的全过程,并给出了关键的性能数据。实验与实测2026/9/21阅读全文 →
在 Apple Silicon Mac 上用 container CLI 跑 Debian 13 并调用本地 Ollama 大模型BLUF本文详细介绍了如何在 Apple Silicon Mac 上使用 Apple 的 container CLI 创建 Debian 13 虚拟机,并配置该虚拟机通过网络调用 Mac GPU 上运行的 Ollama 本地大模型。文章涵盖了从安装 container、构建带 init 的 Debian 镜像、启动虚拟机到配置 Ollama 监听的完整步骤,并提供了性能测试结果和常见问题解决方案。实验与实测2026/9/21阅读全文 →
置顶GAS 不够用?把重活扔给 Gemini 沙箱,用 ggsrun 直传绕开 50MB 和配额限制BLUF这篇文章介绍了一种将 Google Apps Script 与 Gemini 托管代理提供的 Linux 沙盒集成的架构,以执行 GAS 本身无法完成的高负载任务。通过 ggsrun 工具实现云到云的直接文件传输,规避了 API 响应大小和 token 配额限制,大幅提升吞吐和效率。文章提供了完整的客户端库和使用步骤,适合需要突破 GAS 限制的开发者。实验与实测2026/8/31阅读全文 →