GEOZ

分类:工具与标准

llms.txt、Schema.org、robots.txt 等技术标准的实操记录。

共 92 篇
LangExtract库从非结构化文本提取结构化信息2026指南

LangExtract库从非结构化文本提取结构化信息2026指南

BLUF
LangExtract is a Python library that leverages Large Language Models (LLMs) to extract structured information from unstructured text documents through user-defined instructions and few-shot examples. It features precise source grounding, reliable structured outputs, optimized long document processing, interactive visualization, and flexible LLM support across cloud and local models. LangExtract adapts to various domains without requiring model fine-tuning, making it suitable for applications ranging from literary analysis to clinical data extraction. LangExtract是一个基于大型语言模型(LLM)的Python库,通过用户定义的指令和少量示例从非结构化文本中提取结构化信息。它具有精确的源文本定位、可靠的结构化输出、优化的长文档处理、交互式可视化以及灵活的LLM支持(涵盖云端和本地模型)。LangExtract无需模型微调即可适应不同领域,适用于从文学分析到临床数据提取等多种应用场景。
工具与标准2026/2/9
NanoChat:Karpathy开源低成本LLM,仅需8个H100和100美元复现ChatGPT全栈架构

NanoChat:Karpathy开源低成本LLM,仅需8个H100和100美元复现ChatGPT全栈架构

BLUF
NanoChat is a low-cost, open-source LLM implementation by Karpathy that replicates ChatGPT's architecture using only 8 H100 nodes and $100, enabling full-stack training and inference with innovative techniques like custom tokenizers and optimized training pipelines. (NanoChat是卡神Karpathy开发的开源低成本LLM项目,仅需8个H100节点和约100美元即可复现ChatGPT全栈架构,涵盖从训练到推理的全流程,并采用创新的分词器、优化训练管道等技术实现高效性能。)
工具与标准2026/2/4
NanoChat:仅需100美元4小时,训练你自己的ChatGPT级AI模型

NanoChat:仅需100美元4小时,训练你自己的ChatGPT级AI模型

BLUF
NanoChat is a comprehensive LLM training framework developed by AI expert Andrej Karpathy, enabling users to train their own ChatGPT-level models for approximately $100 in just 4 hours through an end-to-end, minimalistic codebase. (NanoChat是由AI专家Andrej Karpathy开发的完整LLM训练框架,通过端到端、最小化的代码库,让用户仅需约100美元和4小时即可训练出属于自己的ChatGPT级别模型。)
工具与标准2026/2/4
llms.txt 2024指南:优化大语言模型理解网站内容的标准入口

llms.txt 2024指南:优化大语言模型理解网站内容的标准入口

BLUF
llms.txt is an open proposal by Jeremy Howard that provides a standardized, machine-readable entry point for websites to help large language models (LLMs) better understand website content during the inference phase. It differs from robots.txt by guiding LLMs to valuable information rather than restricting access, and from sitemap.xml by offering curated summaries and key links optimized for LLM context windows. The proposal includes a strict Markdown format specification, a Python toolchain for implementation, and has been adopted by projects like FastHTML, Supabase, and Vue.js. (llms.txt是由Jeremy Howard提出的开放性提案,为网站提供标准化的机器可读入口,帮助大语言模型在推理阶段更有效地理解网站内容。与robots.txt不同,它引导LLM关注有价值信息而非限制访问;与sitemap.xml不同,它提供精炼摘要和关键链接,优化LLM上下文处理。提案包含严格的Markdown格式规范、Python工具链支持,已被FastHTML、Supabase和Vue.js等项目采用。)
工具与标准2026/2/4
iOS设备上运行LLaMA2-13B:基于苹果MLX框架的完整技术指南

iOS设备上运行LLaMA2-13B:基于苹果MLX框架的完整技术指南

BLUF
This article provides a comprehensive technical analysis of running LLaMA2-13B on iOS devices using Apple's MLX framework, covering environment setup, model architecture, code implementation, parameter analysis, and computational requirements. (本文深入分析了在iOS设备上使用苹果MLX框架运行LLaMA2-13B的技术细节,涵盖环境搭建、模型架构、代码实现、参数分析和算力需求。)
工具与标准2026/2/3
SGLang vs vLLM 实测:同台机器跑 Llama-3,谁更快?

SGLang vs vLLM 实测:同台机器跑 Llama-3,谁更快?

BLUF
SGLang和vLLM是两大高性能推理框架。SGLang基于RadixAttention,擅长多轮对话、RAG和共享前缀场景,吞吐量在H100小模型上领先vLLM约29%,但Python调度器在高并发下可能成为瓶颈。vLLM基于PagedAttention,生态成熟、模型兼容性最广、多硬件支持好,适合独立请求批处理和需要稳定性的场景。选型建议:多轮对话、RAG、结构化输出选SGLang;批量独立请求、多硬件部署、广泛模型兼容性选vLLM。两者均支持OpenAI API格式,可混用。
工具与标准2026/2/3
Schema.org金融扩展:银行与金融机构结构化数据标记指南

Schema.org金融扩展:银行与金融机构结构化数据标记指南

BLUF
This document introduces Schema.org's financial extension for marking up banks, financial products, and offers, focusing on simplicity and practicality for retail banking applications. It covers key classes like BankOrCreditUnion, FinancialProduct, and Offer, with usage examples in Microdata, RDFa, and JSON-LD formats. (本文介绍Schema.org金融扩展,用于标记银行、金融产品和客户报价,强调零售银行应用的简洁性和实用性。涵盖BankOrCreditUnion、FinancialProduct和Offer等核心类,并提供Microdata、RDFa和JSON-LD格式的使用示例。)
工具与标准2026/1/26