Tiger's Blog

  • 首页
  • 读书
  • 日常
读书|运动|学徒|做事
  1. 首页
  2. 日常
  3. 正文

13.5 万条日志复盘:一个独立博客的 GEO 与自进化旁路架构实践

2026年 9月 11日 10点热度 0人点赞 0条评论

从 2026 年 8 月初开始,我尝试给个人独立博客(goagi.top)搭建一套面向大语言模型的优化体系(GEO,Generative Engine Optimization)以及配套的递归自演化引擎(RSI)。

40 天过去,系统经历了从最初的基础旁路搭建,到全站多语言切块,再到接入生产日志驱动策略自进化的完整周期。从腾讯云生产服务器回溯拉取并汇总的 13.5 万条 Nginx 原始访问日志,记录了整个站点在大模型爬虫与真实读者访问维度的结构性变化。

这篇文章记录这套系统的架构设计、落地细节与真实生产数据。


一、 核心指标全周期对比

下表整理了自 8 月初未做优化前,到 9 月中旬系统稳定运行后的核心维度数据变化:

评估维度 8 月初 (GEO 启动前) 8 月中旬 (切块与 IndexNow) 9 月初 (RSI 生产闭环) 9 月中旬 (当前稳定状态) 总体变化趋势
真实人类读者 (日均 UV) 约 200 ~ 240 人 约 250 ~ 270 人 280 ~ 300 人 350 ~ 367 人 稳步增长 +60%,技术读者盘稳固
主流 AI 爬虫单日抓取量 20 ~ 30 次/天 80 ~ 150 次/天 260 ~ 330 次/天 100 ~ 300+ 次/天 日常抓取频次提升 10~15 倍
累计真实大模型抓取量 < 100 次 约 800 次 约 2,000 次 3,912 次 覆盖 OpenAI、Anthropic、Apple 等生态
ChatGPT 终端联网实时引用 0 次 (未被收录) 约 50 次 约 150 次 630 次 真实终端用户向 AI 提问时直接命中引用
搜索引擎爬虫抓取 (Google/Bing) 零星巡检 (~50 次) 周期性脉冲 (200~500) 强广播后 1,713 次 脉冲式批量抓取 (800~1,700) 主动广播大幅压缩了被动等待收录周期
GEO 架构形态 仅传统 HTML 渲染 静态 llms.txt + 多语言切块 动态 Hub + 10 项安全门禁 LKG 递归自进化 + 全网即时同步 生产库零侵入,结构化数据按需直出

二、 架构设计:零侵入的 Sidecar 旁路系统

早期做网站优化,多数方案倾向于在 WordPress 内部折腾:修改数据表、安装臃肿的插件,或者在正文 HTML 里藏入复杂的微格式标记。

这种做法存在两个弊端:一是污染生产数据库,容易引发系统升级冲突;二是膨胀的 DOM 树包含大量导航栏、侧边栏和脚本,大模型爬虫抓取时依然需要消耗算力清洗页面噪音。

这套系统采用了零侵入旁路架构(Sidecar Architecture):

       [ 真实人类访问 ]                     [ 大模型爬虫 / AI 终端 ]
               │                                      │
               ▼                                      ▼
     GET /2026/xx/article/                 GET /llms.txt / RFC 8288 Link
               │                                      │
               ▼                                      ▼
      [ WordPress PHP/MySQL ]                 [ 独立 Sidecar 旁路目录 ]
   (保持原有富文本排版与渲染)              (0 噪音、高密度 Markdown 知识切块)
               │                                      │
               └──────────────────┬───────────────────┘
                                  ▼
                         [ Nginx 接入层 ]
             注入 RFC 8288 Link Headers 路由大模型

核心实现落在 Nginx 接入层。当任何客户端请求文章页面时,WordPress 保持原有的纯净排版输出,但在 HTTP 响应头中通过 RFC 8288 协议注入专用链接:

# Nginx 响应头注入示例
add_header Link '<https://goagi.top/llms.txt>; rel="alternate"; type="text/markdown"';
add_header Link '<https://goagi.top/sitemap-llm.xml>; rel="sitemap"; type="application/xml"';
add_header Link '<https://goagi.top/.well-known/agent.json>; rel="agent-manifest"; type="application/json"';

对于遵守现代 Web 协议的 AI 代理(如 GPTBot、ClaudeBot 等),无需艰难解析庞大的 HTML DOM,可以直接根据响应头重定向至轻量、高密度的 Markdown 知识切块。这种设计既保护了人类读者的纯文本阅读体验,又把机器读取的时延控制在毫秒级别。


三、 自演化机制:RSI 引擎与 Gen 10 统计显著晋升

静态生成的 Markdown 切块存在一个问题:什么样的内容密度、元数据结构和大模型问答对,最容易在真实生产中被大模型采纳?

人为猜测往往偏离实际。系统引入了 RSI(Recursive Self-Improvement,递归自演化)引擎:

  1. 抽象策略基因向量:建立 10 维可变参数 $theta$,涵盖结构化程度、多语言切分粒度、摘要抽取策略、显式/隐式 FAQ 格式等;
  2. 双臂 A/B 实验与离线安全门禁:突变生成的新策略候选集,必须先通过硬门禁检测(无代码断裂、无乱码、无安全注入隐患),随后在分流测试中观察爬虫交互;
  3. 引入生产真实遥测作为仲裁依据:早期引擎依赖本地模型模拟探针打分,容易陷入自我循环的局部最优。9 月初,采集模块完成重构,直接抓取生产 Nginx 访问日志与爬虫真实命中数作为反馈信号。

Gen 10 的历史性晋升:
在演化到第 10 代时,引擎将 schema_profile 突变为 blogposting_faq_visible(显式高意图问答对与结构化可见 FAQ)。在后续 2.4 万次实际请求的遥测样本中,大模型引用命中率提升了 +5.00%,其 95% 置信区间为 [+2.22%, +7.78%],下界稳定大于 0。

系统判定该突变通过统计显著性检验,自动晋升为新的生产基线(LKG,Last Known Good),完成了无人工干预下的闭环自演化。


四、 攻防实战:主动广播与爬虫数据脱水

在推进 GEO 过程中,有两处实操经验值得记录:

1. 从被动等待到主动广播(IndexNow)

传统的收录机制依赖爬虫被动巡检,新发布的文章往往需要数天甚至数周才能被搜索引擎和大模型发现。

系统接入了 IndexNow 协议。每当本地流水线完成文章编译切块,脚本会通过 API 向微软 Bing 及 Copilot 批量广播变更。数据反馈很直观:全站 175 篇切块首次广播后,次日(9 月 6 日)搜索蜘蛛单日抓取量激增至 1,713 次。文章发布后被大模型系统收录的时间窗口,缩短到了 2 到 4 小时以内。

2. 爬虫流量脱水与安全加固

分析生产日志时,发现大量伪造主流 AI 爬虫 User-Agent 的虚假流量。部分恶意脚本伪装成爬虫特征,频繁探测 .env、备份文件及后台接口,40 天内累计捕获了 4,800+ 次恶意探测。

针对这种情况,不能把所有请求都盲目计入 GEO 数据:
* 在 Nginx 层建立白名单与路径校验机制,非规范探测直接以 return 444 丢弃连接,不给予任何 HTTP 响应;
* 配合防火墙做 IP 频次限制与封禁,剔除数据水分,确保留存的 3,912 次大模型调用均为合规生态流量。


五、 各大模型厂商的调阅分布与思考

根据 13.5 万条全量日志的归纳,各大主流 AI 厂商的实际调阅分布如下:

OpenAI GPTBot         [==================================] 1,140 次 (遍历频次最高、全站覆盖深)
Anthropic ClaudeBot   [=======================] 791 次 (对 Sitemap-llm 与切片高度敏感)
ChatGPT-User (终端引用) [==================] 630 次 (真实用户向 ChatGPT 提问时联网召回)
Applebot              [=============] 443 次 (Apple Intelligence 知识索引)
Meta-ExternalAgent    [==========] 336 次 (Meta 生态爬虫)
ByteSpider            [=========] 291 次 (字节跳动 / 豆包生态)
PerplexityBot         [=========] 281 次 (搜索直答问答对深度抓取)

从这一组数据可以得出几点实际结论:

  1. 高意图 FAQ 是大模型召回的核心抓手:真实用户在 ChatGPT、Claude 或 Perplexity 中的提问通常带着明确的情境。从文章中蒸馏出的高意图 FAQ 问答对,能与用户的 Prompt 产生高相关度的向量匹配,促成了 630 次真实的端到端联网引用;
  2. AI 引用反哺了真实人类流量:AI 抓取与人类读者不是对立的。随着文章在各大模型生成答案中的引用频次增加,很多寻找具体技术解决方案的读者通过引用来源重新访问了博客。9 月 10 日全天人类读者达到 367 UV / 856 PV,创下站点建立以来的历史峰值;
  3. 内容密度依然是第一位的生产力:无论是传统 SEO 还是当下的 GEO,底层逻辑并没有本质区别。机器和人都倾向于寻找信息完整、论据充分、无废话的内容。GEO 旁路架构解决了信息传递的效率问题,但真正留住读者与促使模型引用的,始终是文章本身的思考质量。
标签: 暂无
最后更新:2026年 9月 11日

Tiger

安全 & 数据 & 老父亲

点赞
< 上一篇

文章评论

razz evil exclaim smile redface biggrin eek confused idea lol mad twisted rolleyes wink cool arrow neutral cry mrgreen drooling persevering
取消回复

归档

  • 2026 年 9 月
  • 2026 年 8 月
  • 2025 年 4 月
  • 2025 年 3 月
  • 2024 年 12 月
  • 2024 年 11 月
  • 2024 年 10 月
  • 2024 年 9 月
  • 2024 年 8 月
  • 2024 年 7 月
  • 2024 年 6 月
  • 2024 年 5 月
  • 2024 年 4 月
  • 2024 年 3 月

分类

  • 日常
  • 读书

COPYRIGHT © 2024 Tiger's Blog. ALL RIGHTS RESERVED.

Theme Kratos Made By Seaton Jiang