# KryoZon SEO 博客自动化系统 — 总览

> 学习日期:2026-07-19
> 目的:搞懂 Wayne 的 KryoZon 博客自动化全流程,之后迁移到公司 Keychron 的 SEO 博客上
> 相关笔记:[[01 完整流程解读]] · [[02 操作步骤手册]] · [[03 GitHub最新版与本地版差异]] · [[04 迁移到Keychron的思路]]

## 一句话说清这个系统是什么

一套 **Node.js 命令行管线**(不是 n8n,n8n 模板只是早期备选),把「Excel 内容日历里的一行选题」自动变成「Shopify 博客上的一篇成品草稿」:

```
Excel 内容日历 → jobs.csv
→ 调研数据(真实用户反馈语料,Reddit/YouTube 测评)
→ LLM 写文章(英文直出)
→ 注入内链 + 权威外链引用
→ 自动配图(图库/AI生图 + AI 审图)
→ 组装 HTML(Key Takeaways / TOC / 信息图 / FAQ / 引用 / CTA / 作者卡)
→ 多轮 AI 质量评审 + 去 AI 味改写
→ 0-100 确定性打分(低于 70 分拦截)
→ 以 DRAFT 草稿上传 Shopify(绝不自动发布)
→ Google Sheet 同步状态 → 人工审核
→ npm run approve 发布上线
```

## ⚠️ 关于"翻译"的澄清

**这套系统没有翻译环节。** 文章是 LLM 直接用英文生成的(prompt、品牌规范、SEO 规则全是英文语境),不存在"中文写好再翻译成英文"的流程。所谓"去 AI 化 / humanize"是把 AI 味英文改写成自然英文,不是翻译。给 Keychron 用时同样建议英文直出,质量远高于中译英。

## 代码在哪里

| 位置 | 说明 |
|---|---|
| GitHub 私有仓 | `darkfireoffancy1/wayne-cursor-core`,目录 `SEO博客自动化/`(**最新**,最后 push 2026-07-18) |
| Wayne 本机 | `E:\cursor\SEO博客自动化`(生产运行环境) |
| 我本地拷贝 | `/Users/jialuny/Documents/MS YUAN/个人记录/个人项目/kryozon/SEO博客自动化`(**约 2026-04 底的旧版**,缺 5-7 月三个月的演进,见 [[03 GitHub最新版与本地版差异]]) |

访问权限:我的 GitHub 账号 **Carolynyuanyuan** 有该私有仓读权限(ddcarolyn 没有)。拉最新代码:

```bash
gh auth switch --user Carolynyuanyuan
git clone https://github.com/darkfireoffancy1/wayne-cursor-core.git
# 只需要 SEO博客自动化/ 这个子目录
```

## 仓库阅读顺序(Wayne 自己定的)

1. `AGENTS.md` — 红线规则、管线结构、单一真相源(SoT)
2. `README-KryoZon.md` — 操作手册、环境变量、跑批命令
3. `HANDOFF-SUMMARY.md` — 历史决策、已知坑、多轮迭代记录
4. `docs/REPO_MAP.md` — 目录职责,什么该读什么该忽略(`output/` 是运行产物,不是真相)

## 周边生态(同仓库内,配合博客管线)

| 模块 | 作用 |
|---|---|
| `cooling-corpus/` | 本地 RAG 语料库(Reddit 高赞帖 + YouTube 测评转写),2026-06-22 起**替代 NotebookLM** 做调研层 |
| `kryozon-blog-audio/` | 给 Top 博客生成"有感情朗读"音频,传 Shopify CDN,文章内嵌播放器 |
| `gsc-monitor/` | Google Search Console + Clarity + Shopify 订单的日常监控,飞书日报 |
| `博客流量跟踪/` | 周度 CTR 跟踪(`blog_ctr_tracker.py`),驱动标题改写 |
| `_ledgers/word_freq/` | 全站词频周快照,发现 AI 高频词/模板化用语 |
| `ai-visibility/` | 在 Perplexity 等 AI 搜索里测品牌可见度基线 |

## 核心设计思想(值得学的点)

1. **Draft-first + Human-in-the-loop**:AI 只产草稿,发布永远人工触发。
2. **真实用户证据驱动**:文章必须融合 3+ 条 Reddit/论坛逐字原话(带来源链接),这是和纯 AI 水文拉开差距的关键。
3. **多层质量门**:regex 硬规则 lint → 多个 LLM 评审(价值/语气/编辑) → humanizer 重写 → 确定性 0-100 记分卡拦截,层层兜底。
4. **单一真相源(SoT)**:所有"AI 套话黑名单"正则只维护在 `src/data/aiPatterns.js` 和 `src/utils/stripBoilerplate.js` 两个文件,其他模块 import,不允许复制粘贴——防止规则漂移。
5. **降级瀑布**:LLM 有降级链、图片有五级瀑布、每步失败都有 fallback,批量跑 50 篇不会因单点挂掉。
6. **发布后闭环**:GSC/CTR/词频/AI 可见度持续监控,数据反哺选题和标题改写(2026-05-17 的"选题意图门"就是从线上 scroll 数据总结出来的)。
