一、大模型爬虫的“阅读习惯”
很多传统外包建站公司热衷于使用动效十足的单页应用(SPA)或把整页文字做成一张巨幅海报图片。这种网站对大模型而言几乎是一堵“数据黑墙”:
- 图片字无法即时 OCR:大模型在线实时联网搜索(Online Search)对时延要求极高(通常在 800ms~2s 之间),爬虫根本不会在检索阶段耗费昂贵算力对海报图片做深度 OCR;
- 客户端渲染导致空白:传统 Vue/React 项目源码中只有一个空
<div id="app"></div>,爬虫抓取到的 HTML 体积极小且内容为空,直接判定为低质无意义死链; - Token 浪费惩罚:如果网页充斥着上千行的无序
<div>嵌套和内联 base64 样式,大模型在上下文窗口(Context Window)切分时会迅速耗尽 Token 额度,从而放弃阅读正文。
二、AI 友好型网页的技术改造对比
| 技术维度 | 传统落后官网做法 | NextGEO 现代 AI 原生做法 |
|---|---|---|
| 网页渲染方式 | 纯客户端渲染 (CSR) / 模板建站 | 静态预渲染 (SSG) / 服务端直出 (SSR) |
| 文本抽取保真度 | HTML 标签冗余、包含大量广告脚本 | 100% 纯净 Clean Markdown 原生可抽取 |
| 大模型专属索引 | 无(导致爬虫在海量页面中迷失) | 根目录配置标准 /llms.txt 知识清单 |
| 结构化数据 | 缺失,仅有基础标题 Title | 完整 Schema.org JSON-LD 实体图谱 |
三、什么是 /llms.txt?为什么它是未来企业的标配?
正如传统互联网时代企业依靠 /robots.txt 告知搜索引擎爬虫“允许访问什么路径”,在生成式 AI 时代,大模型社区制定了全新的 /llms.txt 开放标准。
/llms.txt 是一个存放于网站根目录的纯文本 Markdown 文件。它为各大模型的 Agent、知识检索器提供了一份精炼、无歧义的企业核心事实纲要与关键方法论文章索引。大模型在检索到该文件后,无需解析复杂的网页样式,就能瞬间掌握企业的服务口径、团队背景与参数细节。