连接日志来源
将服务器和 CDN 日志接入 AI 爬虫追踪。
追踪代码片段上报的是在浏览器或你的服务器上运行时看到的内容,但许多 AI 机器人抓取页面时从不执行 JavaScript。日志来源正好补上这一缺口: 连接你的 CDN 或服务器日志后,每一个与 AI 相关的请求都会被统计,并带有 独立的来源标签,方便你区分日志来源的访问和代码片段来源的访问。
只有与 AI 相关的请求会被存储。已知 AI 爬虫、类机器人代理,以及由 AI 助手引荐的访问会被保留;其他所有流量在到达时即被丢弃,不会写入任何 位置。验证层级对日志来源的访问同样适用,与代码片段访问完全一致。
所有日志来源都使用日志接入密钥进行身份验证。该密钥与你的追踪代码片段 密钥相互独立,只能用于提交日志。下文提到的所有功能都在应用中的 AI 爬虫 → 安装追踪里的"日志来源"面板内。
Cloudflare(一键部署)
对使用 Cloudflare 代理的网站来说,这是最快的路径。创建一个只包含以下 三个权限的 API 令牌:Workers Scripts Edit、Zone Read 和 Workers Routes Edit。粘贴令牌和你的域名,Citlyze 就会在你的 zone 上部署一个小型 Worker,并把它挂载到你域名的路由上。
该 Worker 严格透传:它从不读取或修改请求或响应正文,任何内部错误都会 直接放行,因此你的网站绝不会受到影响。它在响应送出之后才上报请求元数据 (路径、状态码、User-Agent、IP、来源页、国家/地区)。令牌仅在设置时 使用一次,绝不存储。
两点说明:
- 该路由仅对已代理(橙色云)的 DNS 记录生效。
- 在 Workers 免费套餐上,所有请求共享每日配额。预过滤选项让 Worker 只上报 AI User-Agent,可以节省配额,但新注册的爬虫在你重新部署 Worker 之前不会被捕获。
不想粘贴令牌?选择手动方式,Citlyze 会生成同样的 Worker 代码,由你 自己粘贴到 Cloudflare 控制台。
对于流量极高的 zone,Cloudflare Logpush 是更合适的选择:创建一个指向
你的接入 URL 的 HTTP 目标,并在 URL 参数中以 key= 传入密钥,Citlyze
会以同样的方式过滤推送来的批次。
Vercel(log drain)
粘贴一个 Vercel 令牌,Citlyze 会创建一个 log drain,自动持续传入请求 日志。可以把它限定到单个项目,或将项目留空以覆盖整个团队。令牌以加密 方式保存,唯一用途是在你断开连接时移除该 log drain。数据接入本身使用 嵌入在 drain URL 中的日志接入密钥进行身份验证。
通用 Webhook
任何能 POST JSON 的系统都可以接入日志。把每批最多 500 条的日志发送到
接入端点,并在 X-API-Key 请求头中携带你的日志接入密钥。每条日志包含
时间戳、方法、URL、状态码和 User-Agent,还可以附带客户端 IP、来源页和
国家/地区。完整的接口约定见
日志接入 API 参考。
文件上传
如需一次性回填,可以把一段访问日志直接粘贴到"上传"标签页。支持两种 格式:带表头行的 CSV(常见 CDN 导出表头会被自动识别)和 Apache/Nginx combined 日志格式。超过 30 天的条目会被跳过,处理摘要会告诉你解析、 存储和丢弃了多少行。
其他 CDN
CloudFront 和 Akamai 用户目前可以通过通用 Webhook 约定使用同一个 端点:把 Lambda@Edge 函数、DataStream HTTPS 目标或任何日志转发工具 指向接入 URL 并附上你的密钥即可。这些平台的原生一键接入会根据需求 陆续推出。
解读结果
日志来源的访问会出现在与代码片段访问相同的 AI 爬虫和 AI 流量视图中。 公共 API 会在每一行上标明来源,因此导出数据时可以区分代码片段看到的 访问和日志看到的访问。