llms.txt 标准协议
llms.txt Standard Protocol
一个旨在帮助大语言模型(LLM)更好地理解和抓取网站内容的开放标准文件,类似于面向AI的robots.txt。
针对当前网站大量部署llms.txt但缺乏消费端的现状,开发能够解析、利用并分析llms.txt数据的AI中间件或开发者工具。
针对当前网站大量部署llms.txt但缺乏消费端的现状,开发能够解析、利用并分析llms.txt数据的AI中间件或开发者工具。
当前互联网上出现了大量 llms.txt 文件,但现有的AI应用、RAG系统或爬虫框架并没有标准化的模块去高效发现、解析和利用这些文件。网站主不知道自己的 llms.txt 是否被AI读取,而AI开发者也需要手动编写逻辑去适配不同网站的格式。
1. llms.txt 解析API:提供一个标准化的API,输入网址即可返回结构化、清洗后的 llms.txt 内容,方便RAG应用直接调用。 2. AI爬虫中间件:为LangChain、LlamaIndex等框架开发插件,使其在抓取网页时自动寻找并利用 llms.txt。 3. 网站主分析面板:允许网站主提交自己的 llms.txt,监控是否有已知的AI User-Agent 访问过该文件。
llms.txt 规范仍在演进中,可能发生重大变更。llms.txt 也能很好地工作,该市场将不复存在。1. 编写一个简单的脚本,扫描Product Hunt或Indie Hackers上的热门项目,统计包含 llms.txt 的比例。 2. 在开发者社区发起投票或讨论,询问RAG开发者是否愿意付费使用一个稳定可靠的 llms.txt 解析服务。 3. 快速上线一个免费的开源解析库,观察一周内的下载量和Star数,以验证真实需求。