User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /AR103 严重屏蔽 GPTBot 属于退出训练。下面那条通配符规则把所有答案引擎抓取器一起带走了,因为没有自己分组的爬虫会继承通配符规则。
要判断 AI 答案引擎能否引用你的网站,请核实四件事:robots.txt 没有屏蔽 OAI-SearchBot、PerplexityBot、Claude-User 这类检索抓取器;存在一份干净的 Markdown 或 llms.txt 副本,并在页面头部声明;你的 JSON-LD 有效,并且写明了页面背后的组织;你实际输出的 HTML 里已经包含正文,而不是靠 JavaScript 再加载。本工具用你粘贴的文件检查这四点。它无法证明某个助手真的会引用你。
检查你真正对外输出的那个文件
请粘贴完整文件,不要只贴片段。用 curl 取一次 URL 并粘贴响应体,这样你检查的是抓取器实际收到的内容,而不是 CMS 给你看的内容。
快捷键:Ctrl 或 Command + Enter。最大输入:400,000 字符。
粘贴一个完整文件,即可看到评分、未通过的规则,以及每条对应的证据行。
评分衡量的是智能体能否读懂这个文件。它不预测某个助手会引用你。
三个动作
这两者是不同文件的情况,比大多数人以为的更常见,而 AI 可见性就悄悄死在这个差别里。
用 curl 请求你的 robots.txt、llms.txt、Markdown 镜像或页面 URL,复制响应体。CMS 里的预览是你的 CMS 渲染出来的,并不会这样输出给爬虫。
检查器会判断你粘贴的是四种文件类型中的哪一种,只运行适用的规则,并打印触发每条发现的那一行。
导出 JSON 或 Markdown 报告,从最上面开始。严重项就是那些直接把你从答案里剔除的问题,而且通常不会超过两条。
读证据,别读一个神奇分数
真正有意思的,是那些看起来很谨慎、其实并不谨慎的文件。
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /AR103 严重屏蔽 GPTBot 属于退出训练。下面那条通配符规则把所有答案引擎抓取器一起带走了,因为没有自己分组的爬虫会继承通配符规则。
User-agent: CCBot
Disallow: /
Sitemap: https://example.com/sitemap.xmlAR104 低,评分 98同样的写法,但没有通配符。退出训练是授权层面的决定,所以只做提示,不拉低等级。
- [Fractional CTO](/services/fractional-cto-austria/): 领导力AR204 高llms.txt 会被抓走并四处传递,脱离它原本所在的页面,于是没有基准 URL 可以解析。要么用绝对链接,要么别放。
我们凭什么这么说
Markdown 镜像规则是从那个让本站生产构建硬失败的校验器移植过来的。我们不是在描述从别处读来的最佳实践,而是把我们自己必须通过的那道关卡交给你。
镜像规则来自本站仓库里的 scripts/verify_machine_markdown.mjs。哪条规则写错了,坏的先是我们自己的部署,而不是你的审计。
屏蔽 GPTBot 是退出模型训练。屏蔽 OAI-SearchBot 是把自己从答案里删掉。多数 robots.txt 把这两件事当成一个决定,所以本工具分开评分。
每条发现都会打印触发它的那一行和修复方式。一个你无法核查的数字是销售工具,不是诊断工具。
检查器从不请求 URL。你的 staging 主机和内部路径不会进入任何日志,包括我们的日志。
诚实的局限