GEOZ

最新文章

共 1462 篇
Qwen3.8-27B 跑分暴涨三倍,但 API 可用率不到 80%

Qwen3.8-27B 跑分暴涨三倍,但 API 可用率不到 80%

BLUF
Qwen3.8-27B 是阿里 Qwen 团队新发布的 270 亿参数稠密视觉语言模型,支持图像和视频理解,采用 Apache 2.0 开源权重。它在 DeepSWE 1.1 上达到 42.2(前代仅 13.3),在 SWE-bench Pro、OSWorld、AndroidWorld 等多项基准上超越 Claude Opus 4.6 Max,同时能在 16GB 显存的消费级显卡上本地运行。OpenRouter 定价为每百万输入 token $0.45、输出 $3.20。
AI大模型2026/9/21
Qwen3.8 开源:Qwen-Max 级能力首次下放,推理深度可调

Qwen3.8 开源:Qwen-Max 级能力首次下放,推理深度可调

BLUF
Qwen3.8 是 Qwen 系列最新开源模型,首次将 Qwen-Max 级能力开放给社区。它在编码、专业工作、研究和长周期智能体任务上大幅提升,支持通过 reasoning_effort 调节推理深度,并通过 preserve_thinking 保留历史推理上下文。模型权重已在 Hugging Face 和 ModelScope 发布,包含 27B 和 2.4T-A95B 两个版本。
AI大模型2026/9/21
上下文工程落地实战:为什么塞满窗口反而让 Agent 变笨

上下文工程落地实战:为什么塞满窗口反而让 Agent 变笨

BLUF
上下文工程(Context Engineering)关注的是每次调用 LLM 之前,窗口里该放哪些信息、用什么结构放、什么时候放、什么时候撤。它和 Prompt Engineering 的区别在于:后者关心指令怎么写,前者关心调用前的信息组装。文章系统讲解了上下文失效的原因、评估指标、运行时加载策略、长任务上下文管理,以及工程落地的五个模块和原则。
GEO技术2026/9/21
上下文工程只是子集:Harness Engineering 才是 Agent 稳定干活的关键

上下文工程只是子集:Harness Engineering 才是 Agent 稳定干活的关键

BLUF
这篇文章系统介绍了上下文工程和Harness Engineering两个核心概念。上下文工程关注如何在有限的上下文窗口中,选择、组织并注入与任务高度相关的信息,让大模型做出最佳推理。Harness Engineering则更进一步,为Agent搭建完整的运行空间,设计能力结构、协作机制和反馈闭环,让它在特定领域稳定产出高质量结果。两者是子集与超集的关系,上下文工程是设计原则,Harness Engineering是构建目标。
GEO技术2026/9/21
上下文窗口越大越好?Agent 稳定用上资料的真正门槛

上下文窗口越大越好?Agent 稳定用上资料的真正门槛

BLUF
上下文窗口能装更多资料,不代表 Agent 会稳定利用这些资料。Context Engineering 处理的是调用前的信息组装:哪些规则进入消息、哪些证据按需检索、哪些工具可见、历史何时压缩。本文从原理、失效原因、评估指标到运行时加载策略和长任务处理,系统讲解如何让 Agent 真正用好上下文。
GEO技术2026/9/21
Googlebot 抓不到你的网站,AI 搜索里也不会有你

Googlebot 抓不到你的网站,AI 搜索里也不会有你

BLUF
Googlebot 是谷歌搜索的基石,负责发现、抓取并索引网页。本文深入解析 Googlebot 的双重身份(移动端与桌面端)、专用爬虫生态、三阶段流程(抓取、索引、排名)、抓取预算、移动优先索引及其与 AI 搜索的关联,并提供验证与控制 Googlebot 访问的实用方法。
GEO技术2026/9/21