OpenAI把法律检索做进模型底座,Harvey们的护城河还剩多少?BLUFOpenAI推出基于GPT-6 Astra的法律专用平台Astra for Law,整合2.3亿法律URL和99.9%先例数据,在Vals AI测试中全通过率达54%,较通用搜索提升15.3个百分点。这表面是行业赋能,实则是底层模型巨头对垂直法律SaaS护城河的隐蔽收拢,依赖API薄封装的创企将面临价值挤压。AI大模型2026/9/21阅读全文 →
Cloudflare Workers AI 实测:每天免费 1 万 Neurons,比 OpenAI 省 60-90%BLUFWorkers AI 是 Cloudflare 推出的无服务器 AI 推理服务,每天提供 10,000 Neurons 免费额度,付费价格仅为 $0.011/1000 Neurons,比 OpenAI 便宜 60-90%。本文手把手教你三种调用方式:REST API、Workers + Wrangler 部署、以及用 OpenAI SDK 无缝迁移,并附上模型选择和成本计算。AI大模型2026/9/21阅读全文 →
亚马逊内部两千人在用的 Pizza Bot:把 AI 任务当邮件收件箱处理BLUFPizza Bot 是一个异步 AI 工作收件箱,让你启动或安排任务后离开,完成的工作会出现在 Unread 中,待决策事项出现在 Action 中。它支持多种模型提供商,提供桌面、浏览器和 CLI 三种运行方式,并强调本地优先和安全性。AI大模型2026/9/21阅读全文 →
Qurious:用 Convex 和 Vercel AI SDK 重做学术搜索的开源尝试BLUFQurious 是一个开源的 AI 科研助手,帮助研究人员、学生快速发现、理解和组织科学文献。它提供语义搜索、论文对话、AI 摘要等功能,技术栈基于 Next.js、Convex 和 Vercel AI SDK,可本地部署。AI大模型2026/9/21阅读全文 →
RTX 3090 跑大模型实测:24GB 显存能撑到哪一步BLUFRTX 3090 拥有 24GB GDDR6X 显存和 936 GB/s 带宽,目前闲鱼中位价约 8350 元。在 Q4 量化下,它最高能跑 32B 参数模型,预估速度 33 tokens/s。本文整理了完整规格、2026 年新模型的兼容性测试以及多平台价格参考。实验与实测2026/9/21阅读全文 →
三值量化把 27B 模型压到 5.9GB,但视觉能力掉了 3 分BLUFPrismML 发布的 Ternary Bonsai 2 27B 把三值量化推到了 27B 规模,模型体积仅 5.9GB,聚合基准保留率 98.2%,RTX 5090 上吞吐 143 tokens/s。编码几乎无损、指令遵循反升,但视觉掉 3 分,且需要自定义低比特 kernel 才能跑起来。AI大模型2026/9/21阅读全文 →
Qwen3.8-27B 跑分暴涨三倍,但 API 可用率不到 80%BLUFQwen3.8-27B 是阿里 Qwen 团队新发布的 270 亿参数稠密视觉语言模型,支持图像和视频理解,采用 Apache 2.0 开源权重。它在 DeepSWE 1.1 上达到 42.2(前代仅 13.3),在 SWE-bench Pro、OSWorld、AndroidWorld 等多项基准上超越 Claude Opus 4.6 Max,同时能在 16GB 显存的消费级显卡上本地运行。OpenRouter 定价为每百万输入 token $0.45、输出 $3.20。AI大模型2026/9/21阅读全文 →
Qwen3.8 开源:Qwen-Max 级能力首次下放,推理深度可调BLUFQwen3.8 是 Qwen 系列最新开源模型,首次将 Qwen-Max 级能力开放给社区。它在编码、专业工作、研究和长周期智能体任务上大幅提升,支持通过 reasoning_effort 调节推理深度,并通过 preserve_thinking 保留历史推理上下文。模型权重已在 Hugging Face 和 ModelScope 发布,包含 27B 和 2.4T-A95B 两个版本。AI大模型2026/9/21阅读全文 →
MCP 协议想统一大模型与外部工具的连接方式,这次能成吗BLUFMCP(模型上下文协议)是一个开放协议,旨在让 LLM 应用与外部数据源和工具无缝集成。它提供了标准化方式,帮助开发者构建 AI IDE、聊天界面或自定义工作流。该协议由 Linux 基金会托管,并提供多种编程语言的 SDK。AI大模型2026/9/21阅读全文 →