一页结论
最关键的判断:这 10 个仓库不是同一类东西。前 5 个是给 AI agent 使用的“研究流程/投稿/技能路由层”,后 5 个是给 Python 人类用户和程序直接跑模型的“统计建模/因果推断计算层”。真正有价值的用法不是二选一,而是把二者叠起来:用技能库做研究流程和质量门,用 Python 库做可复现估计。
推荐默认组合
实证社科 / 应用经济研究:AERS 或 AER-Skills 做流程编排,StatsPAI 做统一执行,statsmodels / DoWhy / EconML / causalml 作为底层或对照工具。
如果只是学习因果推断:从 python-causality-handbook 入门,再用 DoWhy 理解识别-估计-反驳流程,用 EconML / causalml 进入 CATE 和 uplift。
不要误用
Agent skill 仓库不是“pip 装完就能跑模型”的库;它们更像给 Claude Code / Codex / OpenClaw 的操作手册和模板。反过来,statsmodels、DoWhy、EconML 等库不会替你判断期刊规范、审稿回复、复制包结构和写作质量。
快速选型
| 任务 | 首选 | 备选 / 搭配 | 理由 |
|---|---|---|---|
| 从数据到可投稿实证论文 | Auto-Empirical-Research-Skills + StatsPAI | AER-Skills | AERS 覆盖完整实证生态,StatsPAI 负责统一估计与结构化输出。 |
| AER / AEJ / AER: Insights 投稿 | AER-Skills | StatsPAI、statsmodels、pyfixest、Stata/R 模板 | AER-Skills 聚焦 top-5 经济学约束:识别、复现、表图、审稿回复。 |
| 跨学科选刊与投稿格式 | Awesome-Journal-Skills | AER-Skills 用于经济学深挖 | 覆盖期刊广,适合选刊路由和 submission checklist。 |
| 经典统计建模、回归、时间序列 | statsmodels | StatsPAI 封装式工作流 | 成熟、文档好、生态稳,是 Python 统计建模底座。 |
| 因果图、识别假设、稳健性反驳 | DoWhy | EconML 估计 CATE | DoWhy 的四步法适合把假设显式化,并做 refutation。 |
| 个体化处理效应 / CATE | EconML | DoWhy、causalml | 双重机器学习、因果森林、正交学习方法最系统。 |
| 营销、增长、AB 后的 uplift 建模 | causalml | EconML | 对 uplift curve、meta-learner、treatment targeting 更顺手。 |
| 学习因果推断 | python-causality-handbook | DoWhy notebooks | 讲概念、公式和 Python 实操,比直接读 API 更友好。 |
仓库现状总览
| 仓库 | 类型 | Stars / Forks | 最近提交 | 许可证 | 一句话定位 |
|---|---|---|---|---|---|
| Auto-Empirical-Research-Skills | Agent skills 目录 + 路由器 | 2470 / 335 | 2026-06-26 | CC BY-SA 4.0 | 实证研究 agent 技能大全,仓库自称覆盖 69 个合集、1,145 个 vendored skills,并映射 23k+ 生态。 |
| StatsPAI | Python 计量/因果库 | 258 / 48 | 2026-06-30 | MIT | Agent-native、Stata/R 风格的 Python 实证研究工作台。 |
| Awesome-Journal-Skills | 期刊投稿 skill pack 索引 | 554 / 76 | 2026-06-29 | MIT | 按期刊定制投稿 workflow,README 宣称覆盖 195 个 pack、519 本期刊、155 个 CS/AI 顶会。 |
| AER-Skills | AER/AEJ 专用 skill 栈 | 21 / 5 | 2026-06-23 | MIT | 面向 AER、AER: Insights、AEJ 的识别优先投稿技能栈。 |
| Auto-Research-Skills | 自动化科研生态精选库 | 24 / 3 | 2026-06-29 | CC0-1.0 | 收纳自动化研究 skills、systems、benchmarks、lists 的 hub。 |
| statsmodels | 经典统计建模库 | 11491 / 3454 | 2026-06-30 | BSD-3-Clause | Python 统计、回归、时间序列和计量建模的基础设施。 |
| dowhy | 因果推断框架 | 8192 / 1040 | 2026-06-23 | MIT | 用图模型 + 潜在结果统一识别、估计、反驳。 |
| causalml | Uplift / causal ML | 5892 / 860 | 2026-06-28 | Apache-2.0 | Uber 出品,偏 uplift、meta-learner、营销处理策略。 |
| EconML | CATE / DML / causal ML | 4696 / 814 | 2026-06-11 | MIT + BSD components | 微软 ALICE 项目孵化,聚焦异质性处理效应和正交机器学习。 |
| python-causality-handbook | 因果推断教材 | 3393 / 608 | 2026-06-09 | MIT | 《Causal Inference for the Brave and True》开源实战手册。 |
注:Stars/Forks 与最近提交为 2026-07-01 通过 GitHub API 和本地浅克隆记录的快照,后续会变化。
1. Auto-Empirical-Research-Skills
实证研究 Agent Skills 总路由器
brycewang-stanford/Auto-Empirical-Research-Skills定位:这是一个“给 agent 用的实证研究技能发行版”,不是普通 Python 包。README 明确说仓库根目录可以作为一个整体 router skill 导入 Codex、Claude Code、CodeBuddy 或类似 IDE。它的作用不是一次性把 1,145 个 skill 塞进上下文,而是先查目录,再路由到目标子 skill。
核心内容:AERS 把实证研究拆成全流程、因果推断、文献综述、写作、人类化改写、引用核验、复现包、同行评审等模块。自研主干包括 StatsPAI skill、Python/Stata/R 全流程实证分析 skill、AER-skills、中文去 AIGC、Paper-WorkFlow 等。它也 vendor 了大量社区技能,README 显示 69 个合集、1,145 个 skills,并把更大的 23,000+ skill 生态作为外部地图。
使用方法
- 整仓作为 router skill:将仓库根目录导入支持 skill 的 agent runtime,让根目录
SKILL.md负责路由。真正执行任务时,agent 先查catalog/skills.json或docs/SKILL_CATALOG.md,只读取相关子 skill。 - 单 skill 使用:如果 runtime 要求“一目录一个 skill”,复制直接包含
SKILL.md的子目录,例如skills/50-brycewang-aer-skills/skills/aer-workflow/。 - 校验与审计:高信任场景建议运行仓库内的 audit / validate 命令,特别是 vendor skill 可能来自不同上游,安全和质量不应只看 README。
适合场景
- 你想让 agent 协助完成完整实证研究:选题、数据清洗、识别策略、估计、稳健性、表格、写作、投稿。
- 你在搭建科研 agent profile,希望有一个“大目录 + 按需加载”的技能库。
- 你需要在 Stata、R、Python、LaTeX、期刊格式之间切换,而不是只跑一个模型。
优势与风险
优势:覆盖面极广,研究流程意识强,能把“方法选择”“引用核验”“AER 合规”“复现包”等非代码工作纳入 agent 的操作手册。
风险:数量大不等于每个 skill 都同等成熟;导入全仓会有上下文和命名冲突问题。对于严肃研究,必须把它当作工作流助手,而不是结果正确性的最终保证。
2. StatsPAI
Agent-native 因果计量 Python 工作台
brycewang-stanford/StatsPAI定位:StatsPAI 试图做“Stata/R 的 Python 平替入口”:把 OLS、IV、高维固定效应、DiD、RD、合成控制、匹配、诊断、表格导出和 agent 可读元数据放进统一 API。它与 AERS、AER-Skills、Awesome-Journal-Skills 是同一生态的执行层。
使用方法
pip install statspai
import statspai as sp
card = sp.datasets.card_1995()
ols = sp.regress("lwage ~ educ + exper", data=card, robust="hc1")
print(ols.summary())
典型入口包括:
sp.regress(...):OLS / robust SE,类似 Statareg或 Rlm。sp.ivreg("y ~ (d ~ z) + x", data=df):2SLS / IV。sp.feols("y ~ x | firm + year", data=df):高维固定效应。sp.callaway_santanna()+sp.aggte():现代 staggered DiD。sp.rdrobust():断点回归。sp.synth():合成控制。.summary()、.tidy()、.plot()、.to_latex()、.to_docx()、.to_agent_summary():结构化输出。
适合场景
- 你熟悉 Stata/R,但希望在 Python 中完成日常实证研究。
- 你想让 agent 读取结果对象,而不是解析一堆不稳定的文本输出。
- 你需要把估计、诊断、论文表格和 Word/Excel/LaTeX 导出串成流水线。
优势与风险
优势:API 对实证研究者友好,覆盖设计广,强调 Stata/R parity、内置教学数据、结果对象和 agent summary。对于 agent 工作流,这比让 agent 手写 statsmodels / sklearn / pandas glue code 更稳。
风险:项目相对新,生态和长期稳定性还不能与 statsmodels、DoWhy、EconML 相比。严肃论文应保留底层库、Stata/R 或已发表代码的交叉验证,关注函数的 validation status 与 parity tests。
3. Awesome-Journal-Skills
按期刊定制的投稿技能库
brycewang-stanford/Awesome-Journal-Skills定位:AJS 的核心不是“怎么估计模型”,而是“这篇稿子投哪个期刊、按该期刊该怎么写、怎么检查格式和审稿要求”。它按 11 个学科板块组织,README 宣称覆盖 195 个 pack、519 本顶级期刊、155 个 CS/AI 顶会。
使用方法
- 按学科或目标期刊进入对应
*-Skills目录,例如 AER、QJE、Nature、Cell、管理世界、经济研究等。 - 把目标期刊 skill pack 安装到 Claude Code / Codex / OpenClaw,或者让 agent 读取对应目录中的
SKILL.md、resources、assets。 - 将其用于选刊、摘要长度、图表规范、cover letter、审稿意见分类、R&R 回复、投稿前 checklist。
适合场景
- 跨学科团队不熟悉目标期刊规则,想快速建立投稿路线。
- 需要比较 AER/QJE/Nature/Cell/中文经管期刊/CS 顶会的不同写作与提交要求。
- 想让 agent 做“期刊编辑视角”的稿件预审。
优势与风险
优势:覆盖广,中文/英文顶刊都有,适合做 venue routing 和投稿 checklist。
风险:期刊政策随时间变化,投稿要求必须在最终提交前回到期刊官网核验;skill pack 可以减少遗漏,但不能替代官方 instructions for authors。
4. AER-Skills
AER / AEJ 经济学投稿专用技能栈
brycewang-stanford/AER-Skills定位:这是一个比 AJS 更窄、更深的经济学 top-5 投稿工具箱。它覆盖选题、文献定位、识别策略、稳健性、正文写作、引言、表图、全稿一致性审计、模拟审稿、复现包、投稿与 rebuttal。
使用方法
git clone https://github.com/brycewang-stanford/AER-Skills.git
cd AER-Skills
# Claude Code
python3 scripts/install_skills.py claude
# 或 Codex
python3 scripts/install_skills.py codex
# 新项目脚手架
python3 scripts/scaffold_project.py python /path/to/new-project
python3 scripts/scaffold_project.py skeleton /path/to/new-replication-package
核心流程是:
aer-topic-selection
-> aer-literature
-> aer-identification
-> aer-robustness
-> aer-paper-body
-> aer-introduction
-> aer-tables-figures
-> aer-consistency
-> aer-referee-sim
-> aer-replication
-> aer-submission
-> aer-rebuttal
适合场景
- 经济学、金融、公共政策、应用微观团队准备投 AER、AEJ、AER: Insights 或相邻 top journal。
- 需要把“识别先于写作”变成质量门,而不是最后才发现设计站不住。
- 要做 AEA 合规复制包、openICPSR 结构、表图规范、引用核验和审稿回复。
优势与风险
优势:深度贴合经济学顶刊的真实约束:100 词摘要、AER: Insights 长度规则、强复现要求、弱 IV/TWFE/RDD 常见雷区、booktabs 表格、referee simulation。
风险:它有强烈 AER/AEJ 取向,不适合所有社科期刊。若投管理、社会学、医学或自然科学,应该换 AJS 中的目标期刊 pack。
5. Auto-Research-Skills
自动化科研 skills / systems / benchmarks hub
brycewang-stanford/Auto-Research-Skills定位:ARS 是“自动化科研生态地图”,比 AERS 更泛化。它不仅收 skill,也收端到端自主研究系统、深度研究工具、自动实验智能体、领域科学 agent、评测基准和精选清单。
使用方法
git clone https://github.com/brycewang-stanford/Auto-Research-Skills.git
cd Auto-Research-Skills
./setup.sh
README 提醒不要把所有 skills/ 子模块一次性装进同一个 agent profile,因为同名技能可能冲突。推荐按项目挑一两个集合安装,并查看 catalog/collisions.json。
适合场景
- 你在调研“自动化科研 agent”生态,包括 AI Scientist、deep research、paper-to-code、科研 benchmark。
- 你想给团队建立科研 agent 工具雷达,而不是只做某一篇论文。
- 你要寻找可复用 skill、MCP、benchmark、系统论文配套代码。
优势与风险
优势:生态视野宽,把 skills、systems、benchmarks、lists 放在一起,适合做工具选型和技术路线规划。
风险:它不是针对某个具体实证任务的执行工具,更多是目录和集合。真实使用时需要进一步筛选、安装、验证。
6. statsmodels
Python 统计建模与计量基础设施
statsmodels/statsmodels定位:statsmodels 是 Python 统计建模的老牌核心库,补充 scipy 的统计估计和推断能力。它不是专门的因果推断库,但几乎所有 Python 实证研究都会在某处用到它。
使用方法
pip install statsmodels
# 或
conda install statsmodels
import statsmodels.formula.api as smf
model = smf.ols("y ~ x1 + x2", data=df).fit(cov_type="HC1")
print(model.summary())
主要模块包括 OLS/GLS/WLS、GLM、GEE、Logit/Probit/Poisson/Negative Binomial、稳健线性模型、状态空间、ARIMA/VAR/VECM、时间序列检验、生存分析、MANOVA/PCA/因子分析、非参数、MICE、多重检验、模型诊断和表格输出。
适合场景
- 传统回归、统计检验、时间序列、离散选择模型、稳健标准误。
- 需要可解释、可审计、与统计教科书一致的模型输出。
- 作为 StatsPAI、DoWhy、causalml 等上层库的底座或对照。
优势与风险
优势:成熟、文档系统、社区大、模型广,适合作为 Python 统计推断基线。
风险:面板高维固定效应、现代 DiD、DML、因果图、uplift 等不是它的核心强项;遇到这些任务要配合 linearmodels、pyfixest、DoWhy、EconML、causalml 或 StatsPAI。
7. DoWhy
因果图 + 识别 + 估计 + 反驳的统一框架
py-why/dowhy定位:DoWhy 是 PyWhy 生态的核心因果推断库。它强调把因果假设显式建模,用图模型和潜在结果框架统一语言,然后通过 identify、estimate、refute 四步完成因果分析。
使用方法
pip install dowhy
from dowhy import CausalModel
model = CausalModel(
data=df,
treatment="treatment",
outcome="outcome",
graph="digraph {X -> treatment; X -> outcome; treatment -> outcome;}"
)
identified = model.identify_effect()
estimate = model.estimate_effect(
identified,
method_name="backdoor.propensity_score_matching"
)
refute = model.refute_estimate(
identified,
estimate,
method_name="random_common_cause"
)
DoWhy 还包括 graphical causal model (GCM) 能力,用于根因分析、反事实、异常归因和干预分布模拟;也能桥接 EconML 做 CATE 估计。
适合场景
- 你需要先说清楚 DAG、混杂、识别条件,而不是直接上模型。
- 你希望把同一个估计结果做 placebo、随机共同原因、数据子集等 refutation。
- 产品、运营、平台治理、供应链、因果根因分析等需要解释“为什么”的场景。
优势与风险
优势:方法论结构清楚,非常适合教学、审计和非专家理解因果假设。
风险:DAG 错了,后面再漂亮也没用;估计器本身不是所有场景下最强。做高维 CATE 时通常要接 EconML;做传统经济学表格和期刊输出时要接 statsmodels / StatsPAI。
8. causalml
Uplift 建模和因果机器学习工具箱
uber/causalml定位:CausalML 更靠近业务增长和营销实验:估计不同用户、客户或样本的个体化增量效果,做 treatment targeting 和 uplift evaluation。它同时包含 meta-learners、uplift trees/forests、深度因果模型、指标与验证工具。
使用方法
pip install causalml
# 可选深度学习后端
pip install "causalml[tf]"
pip install "causalml[torch]"
pip install "causalml[jax]"
常见模块:
causalml.inference.meta:S/T/X/R/DR learner 等 meta-learner。causalml.inference.tree:uplift tree / forest。causalml.metrics:AUUC、uplift curve、Qini 等评估。causalml.inference.tf/torch/jax:DragonNet、CEVAE 等深度模型后端。
适合场景
- 营销优惠券、广告投放、CRM 触达、留存干预、价格策略等 uplift / incremental value 问题。
- A/B test 后想训练模型,把“平均效果”转成“对谁最有效”。
- 需要 uplift curve、AUUC、policy targeting 指标,而不仅是估计一个 ATE。
优势与风险
优势:业务 uplift 工具很全,和 sklearn 生态结合自然,评估指标贴近增长团队。
风险:uplift 结果容易被选择偏差、样本重叠不足、未观测混杂误导。若不是随机实验数据,必须严肃处理识别假设;需要 DAG 审计时配 DoWhy,需要更系统 CATE inference 时配 EconML。
9. EconML
异质性处理效应与正交机器学习
py-why/EconML定位:EconML 源于微软研究院 ALICE 项目,目标是把机器学习和计量经济学结合起来,估计 heterogeneous treatment effects。它特别适合 CATE、DML、因果森林、orthogonal forests、IV CATE、policy learning 和解释性分析。
使用方法
pip install econml
from econml.dml import LinearDML
from sklearn.linear_model import LassoCV
est = LinearDML(model_y=LassoCV(), model_t=LassoCV())
est.fit(Y, T, X=X, W=W)
te = est.effect(X_test)
lb, ub = est.effect_interval(X_test, alpha=0.05)
常见估计器包括 LinearDML、SparseLinearDML、NonParamDML、CausalForestDML、DynamicDML、DMLOrthoForest、DROrthoForest、XLearner、SLearner、TLearner,以及 IV 相关 CATE 估计器。
适合场景
- 你关心“哪些人/公司/地区的处理效应更大”,不是只关心 ATE。
- 有高维协变量,需要用 ML 估计 nuisance model,但仍希望保持因果解释。
- 政策学习、个体化决策、异质性分析、反事实策略评估。
优势与风险
优势:CATE 方法体系完整,文档和示例丰富,很多估计器提供置信区间、解释器、model selection 工具。
风险:学习曲线比 DoWhy 和 statsmodels 高。它不会自动替你解决 identification;no unobserved confounding、instrument validity、overlap 等前提仍需研究设计保证。
10. python-causality-handbook
《Causal Inference for the Brave and True》实战手册
matheusfacure/python-causality-handbook定位:这是一本开源教材,不是模型库。它以 Python notebook 形式讲清楚因果推断的基本概念、潜在结果、DAG、偏差、matching、propensity score、DiD、IV、RDD、synthetic control、panel、CATE 等主题。
使用方法
- 在线阅读官方站点:Causal Inference for the Brave and True。
- 克隆仓库运行 notebooks,配合自己的数据改写示例。
- 先学章节,再用 DoWhy / StatsPAI / EconML / causalml 实现工业或论文级流程。
适合场景
- 因果推断入门、团队培训、研究助理 onboarding。
- 需要把 Angrist/Abadie/Walters、Mostly Harmless Econometrics 一类内容转成 Python 实操。
- 在选库之前先建立方法论直觉。
优势与风险
优势:可读性强,概念解释友好,代码贴近真实分析。
风险:教材不是 production API;部分内容作者也标注 Part II 更偏个人经验和实验性。用于论文或生产决策时,需要回到正式库和原始文献。
组合架构建议
架构 A:应用经济学论文流水线
AER-Skills / AERS
负责:选题、文献、识别、稳健性、写作、复现包、审稿回复
StatsPAI
负责:OLS / IV / FE / DiD / RD / SCM / DML、表格导出、agent summary
statsmodels / DoWhy / EconML / causalml
负责:底层估计、交叉验证、特殊方法、机制扩展
适用:论文、政策评估、公司金融/劳动/教育/发展/公共经济学实证项目。这个架构的好处是 agent 不只会“跑回归”,还会检查识别、引用、复现、表图和审稿逻辑。
架构 B:业务增长和个体化决策
DoWhy
负责:DAG、识别假设、refutation
causalml / EconML
负责:uplift、CATE、policy learning
statsmodels
负责:基线回归、诊断、报告中可解释统计模型
适用:优惠券、广告投放、运营触达、推荐策略、定价实验、A/B 后的差异化策略。
架构 C:学习与团队能力建设
python-causality-handbook
负责:概念、公式、直觉、练习
DoWhy
负责:把概念变成四步因果流程
StatsPAI / statsmodels / EconML
负责:进入真实项目
风险清单
| 风险 | 表现 | 缓解方式 |
|---|---|---|
| 把 skill 当成算法库 | 安装 AERS/AER-Skills 后期待直接 pip import 跑模型 | 明确区分 skill 层和 Python 包层;跑模型用 StatsPAI/statsmodels/DoWhy/EconML/causalml。 |
| 把算法输出当成因果结论 | 有 CATE/uplift 曲线就直接做策略 | 先用 DoWhy/AER-Skills 明确识别假设、overlap、混杂和反驳检验。 |
| 仓库新、变动快 | StatsPAI 和若干 skill 仓库 2026 年仍在快速更新 | 固定版本、保存环境、复跑对照、保留原始输出和代码。 |
| 期刊要求过期 | skill pack 中的 submission checklist 与官网不一致 | 最终投稿前必须查目标期刊官网。 |
| 全量导入冲突 | 多个 skill 同名、上下文过大、路由混乱 | 使用 router 或按项目挑选 1-3 个 relevant skill packs。 |
最终建议
- 如果你要做严肃实证论文:优先用 AERS 或 AER-Skills 作为 agent 流程层,用 StatsPAI 做主要执行层,再用 statsmodels/DoWhy/EconML/causalml 做方法补强和交叉验证。
- 如果你要做业务因果和 uplift:不要从 AER-Skills 开始,直接用 DoWhy 建假设,用 causalml/EconML 做异质性与策略,用 statsmodels 做解释性基线。
- 如果你要学习:先读 python-causality-handbook;不要一上来啃 EconML 的复杂 estimator。
- 如果你要投不同期刊:Awesome-Journal-Skills 做选刊和投稿 checklist,AER-Skills 只在经济学 AER/AEJ 场景深用。
- 如果要让 agent 长期参与科研:不要追求一次装满所有 skill。更稳的做法是建立“router + 少量高质量 skill + 可复现 Python 包 + 版本锁定”的工作台。