把你订阅的所有 Substack newsletter,批量抓到本地,增量拉取新文章并转成 Markdown 全文,再按「四赛道 × 四维度」整理成中文投研速览。
它做什么、不做什么:它只读取你自己订阅的 Substack 内容(订阅列表 + 文章正文 + RSS),不破解付费墙、不碰你的账号密码。你需要做的只有一次:在浏览器登录 substack.com,导出一个登录态 Cookie 填进配置文件。
零第三方依赖:采集脚本只用 Python 3.9+ 标准库,不用
pip install任何东西。
打开「终端」,照着做。
- 浏览器打开 substack.com 并登录
- 按
F12(Mac 是Cmd+Option+I)→ 点顶部「应用 / Application」标签 - 左侧「存储 → Cookie → https://substack.com」→ 找到
substack.sid - 复制它的值(一长串以
s%3A开头)
cd substack-collector-skill
cp config.example.json config.json # 若没有该文件则手动创建编辑 config.json:
{
"substack_sid": "把 substack.sid 的值粘贴到这里"
}python3 scripts/substack_collect.py # 拉订阅列表 + 增量拉文章
python3 scripts/substack_collect.py --days 7 # 首次/补抓最近 7 天
python3 scripts/substack_collect.py --full # 拉文章 + 抓全文(转 Markdown)
python3 scripts/substack_collect.py --list-only # 只拉订阅列表跑完会在脚本同目录生成:
data/
├── subscriptions.json # 你订阅的所有 newsletter(名称 + 链接)
├── articles.json # 累积的文章元数据(标题/日期/链接/摘要)
├── fulltext/ # 每篇完整正文(Markdown)
└── state.json # 增量状态(自动记录上次运行时间)
想每天自动拉,把下面这行加进你的 cron(或 WorkBuddy 定时任务):
0 9 * * * python3 /你的路径/substack-collector-skill/scripts/substack_collect.py --full增量逻辑:首次回看最近 7 天,之后只拉「上次运行之后」的新文章(每天准点跑 ≈ 过去 24 小时;漏跑会自动补上,不重复)。
references/分析框架.md 是一套面向一级市场 VC 的投研整理框架:
- 四赛道:New Labs(新型实验室)/ AI for Science / 具身智能 / AI-Infra
- 四维度:行业研究(逻辑推理链 + 赛道线索)/ 项目交流(项目阶段判断)/ 渠道建设(公众号选题库)/ 投后管理
- 信息源分层:技术层喂判断、商业层喂估值、执行层只喂理解——帮你决定每个频道该精读还是扫读
把采集到的全文喂给这套框架,即可产出按主题 + 时间线组织的中文投研速览。
# 复制到用户级 skills 目录即可被识别
cp -r substack-collector-skill ~/.workbuddy/skills/substack-collector然后对 WorkBuddy 说「整理一下 Substack」即可触发。
- Cookie 会过期(几周到约 1 个月),失效时重新登录 substack.com 并更新
config.json。 - 仅供访问你自己订阅/有权访问的内容。请遵守 Substack 服务条款与版权。
- 若有疑问或想改进,欢迎提 Issue。