Research Agent & Causal Inference Stack

实证研究 Agent Skills 与因果计量 Python 库调研报告

对 10 个仓库做逐项分析:Auto-Empirical-Research-Skills、StatsPAI、Awesome-Journal-Skills、AER-Skills、Auto-Research-Skills、statsmodels、DoWhy、CausalML、EconML、python-causality-handbook。重点放在使用方法、适合场景、组合路线和风险边界。

生成日期:2026-07-01 数据源:GitHub API + 仓库 README / 文档 本地浅克隆核验:10/10

一页结论

最关键的判断:这 10 个仓库不是同一类东西。前 5 个是给 AI agent 使用的“研究流程/投稿/技能路由层”,后 5 个是给 Python 人类用户和程序直接跑模型的“统计建模/因果推断计算层”。真正有价值的用法不是二选一,而是把二者叠起来:用技能库做研究流程和质量门,用 Python 库做可复现估计。

推荐默认组合

实证社科 / 应用经济研究:AERS 或 AER-Skills 做流程编排,StatsPAI 做统一执行,statsmodels / DoWhy / EconML / causalml 作为底层或对照工具。

如果只是学习因果推断:从 python-causality-handbook 入门,再用 DoWhy 理解识别-估计-反驳流程,用 EconML / causalml 进入 CATE 和 uplift。

不要误用

Agent skill 仓库不是“pip 装完就能跑模型”的库;它们更像给 Claude Code / Codex / OpenClaw 的操作手册和模板。反过来,statsmodels、DoWhy、EconML 等库不会替你判断期刊规范、审稿回复、复制包结构和写作质量。

快速选型

任务首选备选 / 搭配理由
从数据到可投稿实证论文Auto-Empirical-Research-Skills + StatsPAIAER-SkillsAERS 覆盖完整实证生态,StatsPAI 负责统一估计与结构化输出。
AER / AEJ / AER: Insights 投稿AER-SkillsStatsPAI、statsmodels、pyfixest、Stata/R 模板AER-Skills 聚焦 top-5 经济学约束:识别、复现、表图、审稿回复。
跨学科选刊与投稿格式Awesome-Journal-SkillsAER-Skills 用于经济学深挖覆盖期刊广,适合选刊路由和 submission checklist。
经典统计建模、回归、时间序列statsmodelsStatsPAI 封装式工作流成熟、文档好、生态稳,是 Python 统计建模底座。
因果图、识别假设、稳健性反驳DoWhyEconML 估计 CATEDoWhy 的四步法适合把假设显式化,并做 refutation。
个体化处理效应 / CATEEconMLDoWhy、causalml双重机器学习、因果森林、正交学习方法最系统。
营销、增长、AB 后的 uplift 建模causalmlEconML对 uplift curve、meta-learner、treatment targeting 更顺手。
学习因果推断python-causality-handbookDoWhy notebooks讲概念、公式和 Python 实操,比直接读 API 更友好。

仓库现状总览

仓库类型Stars / Forks最近提交许可证一句话定位
Auto-Empirical-Research-SkillsAgent skills 目录 + 路由器2470 / 3352026-06-26CC BY-SA 4.0实证研究 agent 技能大全,仓库自称覆盖 69 个合集、1,145 个 vendored skills,并映射 23k+ 生态。
StatsPAIPython 计量/因果库258 / 482026-06-30MITAgent-native、Stata/R 风格的 Python 实证研究工作台。
Awesome-Journal-Skills期刊投稿 skill pack 索引554 / 762026-06-29MIT按期刊定制投稿 workflow,README 宣称覆盖 195 个 pack、519 本期刊、155 个 CS/AI 顶会。
AER-SkillsAER/AEJ 专用 skill 栈21 / 52026-06-23MIT面向 AER、AER: Insights、AEJ 的识别优先投稿技能栈。
Auto-Research-Skills自动化科研生态精选库24 / 32026-06-29CC0-1.0收纳自动化研究 skills、systems、benchmarks、lists 的 hub。
statsmodels经典统计建模库11491 / 34542026-06-30BSD-3-ClausePython 统计、回归、时间序列和计量建模的基础设施。
dowhy因果推断框架8192 / 10402026-06-23MIT用图模型 + 潜在结果统一识别、估计、反驳。
causalmlUplift / causal ML5892 / 8602026-06-28Apache-2.0Uber 出品,偏 uplift、meta-learner、营销处理策略。
EconMLCATE / DML / causal ML4696 / 8142026-06-11MIT + BSD components微软 ALICE 项目孵化,聚焦异质性处理效应和正交机器学习。
python-causality-handbook因果推断教材3393 / 6082026-06-09MIT《Causal Inference for the Brave and True》开源实战手册。

注:Stars/Forks 与最近提交为 2026-07-01 通过 GitHub API 和本地浅克隆记录的快照,后续会变化。

1. Auto-Empirical-Research-Skills

实证研究 Agent Skills 总路由器

brycewang-stanford/Auto-Empirical-Research-Skills

定位:这是一个“给 agent 用的实证研究技能发行版”,不是普通 Python 包。README 明确说仓库根目录可以作为一个整体 router skill 导入 Codex、Claude Code、CodeBuddy 或类似 IDE。它的作用不是一次性把 1,145 个 skill 塞进上下文,而是先查目录,再路由到目标子 skill。

核心内容:AERS 把实证研究拆成全流程、因果推断、文献综述、写作、人类化改写、引用核验、复现包、同行评审等模块。自研主干包括 StatsPAI skill、Python/Stata/R 全流程实证分析 skill、AER-skills、中文去 AIGC、Paper-WorkFlow 等。它也 vendor 了大量社区技能,README 显示 69 个合集、1,145 个 skills,并把更大的 23,000+ skill 生态作为外部地图。

使用方法

适合场景

优势与风险

优势:覆盖面极广,研究流程意识强,能把“方法选择”“引用核验”“AER 合规”“复现包”等非代码工作纳入 agent 的操作手册。

风险:数量大不等于每个 skill 都同等成熟;导入全仓会有上下文和命名冲突问题。对于严肃研究,必须把它当作工作流助手,而不是结果正确性的最终保证。

2. StatsPAI

Agent-native 因果计量 Python 工作台

brycewang-stanford/StatsPAI

定位:StatsPAI 试图做“Stata/R 的 Python 平替入口”:把 OLS、IV、高维固定效应、DiD、RD、合成控制、匹配、诊断、表格导出和 agent 可读元数据放进统一 API。它与 AERS、AER-Skills、Awesome-Journal-Skills 是同一生态的执行层。

使用方法

pip install statspai

import statspai as sp
card = sp.datasets.card_1995()
ols = sp.regress("lwage ~ educ + exper", data=card, robust="hc1")
print(ols.summary())

典型入口包括:

适合场景

优势与风险

优势:API 对实证研究者友好,覆盖设计广,强调 Stata/R parity、内置教学数据、结果对象和 agent summary。对于 agent 工作流,这比让 agent 手写 statsmodels / sklearn / pandas glue code 更稳。

风险:项目相对新,生态和长期稳定性还不能与 statsmodels、DoWhy、EconML 相比。严肃论文应保留底层库、Stata/R 或已发表代码的交叉验证,关注函数的 validation status 与 parity tests。

3. Awesome-Journal-Skills

按期刊定制的投稿技能库

brycewang-stanford/Awesome-Journal-Skills

定位:AJS 的核心不是“怎么估计模型”,而是“这篇稿子投哪个期刊、按该期刊该怎么写、怎么检查格式和审稿要求”。它按 11 个学科板块组织,README 宣称覆盖 195 个 pack、519 本顶级期刊、155 个 CS/AI 顶会。

使用方法

适合场景

优势与风险

优势:覆盖广,中文/英文顶刊都有,适合做 venue routing 和投稿 checklist。

风险:期刊政策随时间变化,投稿要求必须在最终提交前回到期刊官网核验;skill pack 可以减少遗漏,但不能替代官方 instructions for authors。

4. AER-Skills

AER / AEJ 经济学投稿专用技能栈

brycewang-stanford/AER-Skills

定位:这是一个比 AJS 更窄、更深的经济学 top-5 投稿工具箱。它覆盖选题、文献定位、识别策略、稳健性、正文写作、引言、表图、全稿一致性审计、模拟审稿、复现包、投稿与 rebuttal。

使用方法

git clone https://github.com/brycewang-stanford/AER-Skills.git
cd AER-Skills

# Claude Code
python3 scripts/install_skills.py claude

# 或 Codex
python3 scripts/install_skills.py codex

# 新项目脚手架
python3 scripts/scaffold_project.py python /path/to/new-project
python3 scripts/scaffold_project.py skeleton /path/to/new-replication-package

核心流程是:

aer-topic-selection
  -> aer-literature
  -> aer-identification
  -> aer-robustness
  -> aer-paper-body
  -> aer-introduction
  -> aer-tables-figures
  -> aer-consistency
  -> aer-referee-sim
  -> aer-replication
  -> aer-submission
  -> aer-rebuttal

适合场景

优势与风险

优势:深度贴合经济学顶刊的真实约束:100 词摘要、AER: Insights 长度规则、强复现要求、弱 IV/TWFE/RDD 常见雷区、booktabs 表格、referee simulation。

风险:它有强烈 AER/AEJ 取向,不适合所有社科期刊。若投管理、社会学、医学或自然科学,应该换 AJS 中的目标期刊 pack。

5. Auto-Research-Skills

自动化科研 skills / systems / benchmarks hub

brycewang-stanford/Auto-Research-Skills

定位:ARS 是“自动化科研生态地图”,比 AERS 更泛化。它不仅收 skill,也收端到端自主研究系统、深度研究工具、自动实验智能体、领域科学 agent、评测基准和精选清单。

使用方法

git clone https://github.com/brycewang-stanford/Auto-Research-Skills.git
cd Auto-Research-Skills
./setup.sh

README 提醒不要把所有 skills/ 子模块一次性装进同一个 agent profile,因为同名技能可能冲突。推荐按项目挑一两个集合安装,并查看 catalog/collisions.json

适合场景

优势与风险

优势:生态视野宽,把 skills、systems、benchmarks、lists 放在一起,适合做工具选型和技术路线规划。

风险:它不是针对某个具体实证任务的执行工具,更多是目录和集合。真实使用时需要进一步筛选、安装、验证。

6. statsmodels

Python 统计建模与计量基础设施

statsmodels/statsmodels

定位:statsmodels 是 Python 统计建模的老牌核心库,补充 scipy 的统计估计和推断能力。它不是专门的因果推断库,但几乎所有 Python 实证研究都会在某处用到它。

使用方法

pip install statsmodels
# 或
conda install statsmodels

import statsmodels.formula.api as smf
model = smf.ols("y ~ x1 + x2", data=df).fit(cov_type="HC1")
print(model.summary())

主要模块包括 OLS/GLS/WLS、GLM、GEE、Logit/Probit/Poisson/Negative Binomial、稳健线性模型、状态空间、ARIMA/VAR/VECM、时间序列检验、生存分析、MANOVA/PCA/因子分析、非参数、MICE、多重检验、模型诊断和表格输出。

适合场景

优势与风险

优势:成熟、文档系统、社区大、模型广,适合作为 Python 统计推断基线。

风险:面板高维固定效应、现代 DiD、DML、因果图、uplift 等不是它的核心强项;遇到这些任务要配合 linearmodels、pyfixest、DoWhy、EconML、causalml 或 StatsPAI。

7. DoWhy

因果图 + 识别 + 估计 + 反驳的统一框架

py-why/dowhy

定位:DoWhy 是 PyWhy 生态的核心因果推断库。它强调把因果假设显式建模,用图模型和潜在结果框架统一语言,然后通过 identify、estimate、refute 四步完成因果分析。

使用方法

pip install dowhy

from dowhy import CausalModel

model = CausalModel(
    data=df,
    treatment="treatment",
    outcome="outcome",
    graph="digraph {X -> treatment; X -> outcome; treatment -> outcome;}"
)
identified = model.identify_effect()
estimate = model.estimate_effect(
    identified,
    method_name="backdoor.propensity_score_matching"
)
refute = model.refute_estimate(
    identified,
    estimate,
    method_name="random_common_cause"
)

DoWhy 还包括 graphical causal model (GCM) 能力,用于根因分析、反事实、异常归因和干预分布模拟;也能桥接 EconML 做 CATE 估计。

适合场景

优势与风险

优势:方法论结构清楚,非常适合教学、审计和非专家理解因果假设。

风险:DAG 错了,后面再漂亮也没用;估计器本身不是所有场景下最强。做高维 CATE 时通常要接 EconML;做传统经济学表格和期刊输出时要接 statsmodels / StatsPAI。

8. causalml

Uplift 建模和因果机器学习工具箱

uber/causalml

定位:CausalML 更靠近业务增长和营销实验:估计不同用户、客户或样本的个体化增量效果,做 treatment targeting 和 uplift evaluation。它同时包含 meta-learners、uplift trees/forests、深度因果模型、指标与验证工具。

使用方法

pip install causalml
# 可选深度学习后端
pip install "causalml[tf]"
pip install "causalml[torch]"
pip install "causalml[jax]"

常见模块:

适合场景

优势与风险

优势:业务 uplift 工具很全,和 sklearn 生态结合自然,评估指标贴近增长团队。

风险:uplift 结果容易被选择偏差、样本重叠不足、未观测混杂误导。若不是随机实验数据,必须严肃处理识别假设;需要 DAG 审计时配 DoWhy,需要更系统 CATE inference 时配 EconML。

9. EconML

异质性处理效应与正交机器学习

py-why/EconML

定位:EconML 源于微软研究院 ALICE 项目,目标是把机器学习和计量经济学结合起来,估计 heterogeneous treatment effects。它特别适合 CATE、DML、因果森林、orthogonal forests、IV CATE、policy learning 和解释性分析。

使用方法

pip install econml

from econml.dml import LinearDML
from sklearn.linear_model import LassoCV

est = LinearDML(model_y=LassoCV(), model_t=LassoCV())
est.fit(Y, T, X=X, W=W)
te = est.effect(X_test)
lb, ub = est.effect_interval(X_test, alpha=0.05)

常见估计器包括 LinearDMLSparseLinearDMLNonParamDMLCausalForestDMLDynamicDMLDMLOrthoForestDROrthoForest、XLearner、SLearner、TLearner,以及 IV 相关 CATE 估计器。

适合场景

优势与风险

优势:CATE 方法体系完整,文档和示例丰富,很多估计器提供置信区间、解释器、model selection 工具。

风险:学习曲线比 DoWhy 和 statsmodels 高。它不会自动替你解决 identification;no unobserved confounding、instrument validity、overlap 等前提仍需研究设计保证。

10. python-causality-handbook

《Causal Inference for the Brave and True》实战手册

matheusfacure/python-causality-handbook

定位:这是一本开源教材,不是模型库。它以 Python notebook 形式讲清楚因果推断的基本概念、潜在结果、DAG、偏差、matching、propensity score、DiD、IV、RDD、synthetic control、panel、CATE 等主题。

使用方法

适合场景

优势与风险

优势:可读性强,概念解释友好,代码贴近真实分析。

风险:教材不是 production API;部分内容作者也标注 Part II 更偏个人经验和实验性。用于论文或生产决策时,需要回到正式库和原始文献。

组合架构建议

架构 A:应用经济学论文流水线

AER-Skills / AERS
  负责:选题、文献、识别、稳健性、写作、复现包、审稿回复

StatsPAI
  负责:OLS / IV / FE / DiD / RD / SCM / DML、表格导出、agent summary

statsmodels / DoWhy / EconML / causalml
  负责:底层估计、交叉验证、特殊方法、机制扩展

适用:论文、政策评估、公司金融/劳动/教育/发展/公共经济学实证项目。这个架构的好处是 agent 不只会“跑回归”,还会检查识别、引用、复现、表图和审稿逻辑。

架构 B:业务增长和个体化决策

DoWhy
  负责:DAG、识别假设、refutation

causalml / EconML
  负责:uplift、CATE、policy learning

statsmodels
  负责:基线回归、诊断、报告中可解释统计模型

适用:优惠券、广告投放、运营触达、推荐策略、定价实验、A/B 后的差异化策略。

架构 C:学习与团队能力建设

python-causality-handbook
  负责:概念、公式、直觉、练习

DoWhy
  负责:把概念变成四步因果流程

StatsPAI / statsmodels / EconML
  负责:进入真实项目

风险清单

风险表现缓解方式
把 skill 当成算法库安装 AERS/AER-Skills 后期待直接 pip import 跑模型明确区分 skill 层和 Python 包层;跑模型用 StatsPAI/statsmodels/DoWhy/EconML/causalml。
把算法输出当成因果结论有 CATE/uplift 曲线就直接做策略先用 DoWhy/AER-Skills 明确识别假设、overlap、混杂和反驳检验。
仓库新、变动快StatsPAI 和若干 skill 仓库 2026 年仍在快速更新固定版本、保存环境、复跑对照、保留原始输出和代码。
期刊要求过期skill pack 中的 submission checklist 与官网不一致最终投稿前必须查目标期刊官网。
全量导入冲突多个 skill 同名、上下文过大、路由混乱使用 router 或按项目挑选 1-3 个 relevant skill packs。

最终建议

  1. 如果你要做严肃实证论文:优先用 AERS 或 AER-Skills 作为 agent 流程层,用 StatsPAI 做主要执行层,再用 statsmodels/DoWhy/EconML/causalml 做方法补强和交叉验证。
  2. 如果你要做业务因果和 uplift:不要从 AER-Skills 开始,直接用 DoWhy 建假设,用 causalml/EconML 做异质性与策略,用 statsmodels 做解释性基线。
  3. 如果你要学习:先读 python-causality-handbook;不要一上来啃 EconML 的复杂 estimator。
  4. 如果你要投不同期刊:Awesome-Journal-Skills 做选刊和投稿 checklist,AER-Skills 只在经济学 AER/AEJ 场景深用。
  5. 如果要让 agent 长期参与科研:不要追求一次装满所有 skill。更稳的做法是建立“router + 少量高质量 skill + 可复现 Python 包 + 版本锁定”的工作台。

资料来源