GEOZ

标签:Gemini

查看包含 Gemini 标签的所有文章。

共 138 篇
打断延迟压到毫秒级:用 Gemini Live API 搭建实时语音代理

打断延迟压到毫秒级:用 Gemini Live API 搭建实时语音代理

BLUF
本文介绍了如何使用 Gemini Live API 构建一个实时语音代理,实现类似真人对话的交互体验。文章对比了传统文本转语音(TTS)与 Gemini Live 的音频到音频模式,并详细讲解了架构设计、核心循环、打断技巧以及工具集成等关键步骤。通过异步确认模式,可以避免工具执行导致的对话停顿。
Gemini2026/9/29
10款大模型计数能力实测:让模型自己数330个ID,最贵的Claude Opus 5只对了9次

10款大模型计数能力实测:让模型自己数330个ID,最贵的Claude Opus 5只对了9次

BLUF
这篇基准测试对比了10款大模型在工具调用场景下的计数能力。当工具直接返回精确计数时,几乎所有模型都能正确回答;但当工具返回ID列表需要模型自己数时,模型表现出现严重分化:愿意花更多token推理的模型计数准确,而快速回答的模型错误率极高。结论是:把计数逻辑放在工具端,而不是让模型自己数。
实验与实测2026/9/29
中美AI治理对话与OpenAI智能体越权事件:同一天的两条信号

中美AI治理对话与OpenAI智能体越权事件:同一天的两条信号

BLUF
这是一份AI领域每日新闻汇总,涵盖中美两国元首关于人工智能的对话、OpenAI智能体越权访问澳大利亚政府系统、Black Forest Labs发布机器人动作模型、谷歌Gemini虚拟人功能上线、以及多篇arXiv论文和开源项目动态。内容涉及政策、安全、产品、模型和学术研究等多个方面。
AI 搜索观察2026/9/26
TPU v6e 跑 Gemma 4 决策推理:比 L4 快一倍,成本却贵 3.7 倍

TPU v6e 跑 Gemma 4 决策推理:比 L4 快一倍,成本却贵 3.7 倍

BLUF
本文手把手教你在单颗 Google Cloud TPU v6e 芯片上,用 vLLM 部署 Gemma 4 系列模型,并运行 Jev 风格的决策模型。文章对比了 TPU v6e 与 NVIDIA L4 GPU 的推理表现,发现 26B-A4B 模型在 TPU 上决策延迟为 27-33 毫秒,远快于 L4 的 61 毫秒,但按需计费成本更高,推荐使用 12B 模型。
实验与实测2026/9/25
用 Docker Compose 把 LiteLLM 跑成生产级 AI 网关:虚拟密钥、消费追踪与监控一次配齐

用 Docker Compose 把 LiteLLM 跑成生产级 AI 网关:虚拟密钥、消费追踪与监控一次配齐

BLUF
本教程详细介绍了如何在Linux服务器上使用Docker Compose部署LiteLLM,一个开源AI网关,提供统一的OpenAI兼容API,支持超过100个LLM提供商。通过集成PostgreSQL进行持久化存储、Prometheus进行指标收集、Traefik作为反向代理,你将搭建一个具备虚拟密钥管理、支出跟踪和提供商路由功能的生产级AI网关。
GEO技术2026/9/24