GEOZ

分类:实验与实测

我们自己跑过的测试、对比数据、复盘和结论。不转述二手信息,只写亲手验证的。

共 290 篇
单张 TPU v5e 跑 12B 模型:重打包 Gemma 4 QAT 权重实测

单张 TPU v5e 跑 12B 模型:重打包 Gemma 4 QAT 权重实测

BLUF
本文提供了一份分步指南,教你如何将 Google 量化感知训练(QAT)的 Gemma 4 权重重新打包,以便在单块 Google Cloud TPU v5e 芯片上通过 vLLM 部署。重打包后的模型在分类、数学、工具调用等任务上表现与 bf16 相当,甚至优于 Google 官方的 4-bit 导出,同时支持从 E2B 到 26B 的所有尺寸。
实验与实测2026/10/3
10款大模型计数能力实测:让模型自己数330个ID,最贵的Claude Opus 5只对了9次

10款大模型计数能力实测:让模型自己数330个ID,最贵的Claude Opus 5只对了9次

BLUF
这篇基准测试对比了10款大模型在工具调用场景下的计数能力。当工具直接返回精确计数时,几乎所有模型都能正确回答;但当工具返回ID列表需要模型自己数时,模型表现出现严重分化:愿意花更多token推理的模型计数准确,而快速回答的模型错误率极高。结论是:把计数逻辑放在工具端,而不是让模型自己数。
实验与实测2026/9/29
TPU v6e 跑 Gemma 4 决策推理:比 L4 快一倍,成本却贵 3.7 倍

TPU v6e 跑 Gemma 4 决策推理:比 L4 快一倍,成本却贵 3.7 倍

BLUF
本文手把手教你在单颗 Google Cloud TPU v6e 芯片上,用 vLLM 部署 Gemma 4 系列模型,并运行 Jev 风格的决策模型。文章对比了 TPU v6e 与 NVIDIA L4 GPU 的推理表现,发现 26B-A4B 模型在 TPU 上决策延迟为 27-33 毫秒,远快于 L4 的 61 毫秒,但按需计费成本更高,推荐使用 12B 模型。
实验与实测2026/9/25
单卡 MI300X 跑 Gemma 4 E2B:64 流吞吐破万,每美元 2713 tok/s

单卡 MI300X 跑 Gemma 4 E2B:64 流吞吐破万,每美元 2713 tok/s

BLUF
本文提供了一份在 AMD Instinct MI300X 上部署 Gemma 4 E2B 模型的完整指南。通过 AMD Developer Cloud 获取 GPU 资源,并使用 vLLM 进行服务化,同时配套了一套基于 Python MCP 的工具集来简化部署管理。文章详细记录了从环境准备、镜像选择、服务启动到性能测试的全过程,并给出了关键的性能数据。
实验与实测2026/9/21
在 Apple Silicon Mac 上用 container CLI 跑 Debian 13 并调用本地 Ollama 大模型

在 Apple Silicon Mac 上用 container CLI 跑 Debian 13 并调用本地 Ollama 大模型

BLUF
本文详细介绍了如何在 Apple Silicon Mac 上使用 Apple 的 container CLI 创建 Debian 13 虚拟机,并配置该虚拟机通过网络调用 Mac GPU 上运行的 Ollama 本地大模型。文章涵盖了从安装 container、构建带 init 的 Debian 镜像、启动虚拟机到配置 Ollama 监听的完整步骤,并提供了性能测试结果和常见问题解决方案。
实验与实测2026/9/21
GAS 不够用?把重活扔给 Gemini 沙箱,用 ggsrun 直传绕开 50MB 和配额限制
置顶

GAS 不够用?把重活扔给 Gemini 沙箱,用 ggsrun 直传绕开 50MB 和配额限制

BLUF
这篇文章介绍了一种将 Google Apps Script 与 Gemini 托管代理提供的 Linux 沙盒集成的架构,以执行 GAS 本身无法完成的高负载任务。通过 ggsrun 工具实现云到云的直接文件传输,规避了 API 响应大小和 token 配额限制,大幅提升吞吐和效率。文章提供了完整的客户端库和使用步骤,适合需要突破 GAS 限制的开发者。
实验与实测2026/8/31
上一页
1 / 25
下一页