repo-intake-and-plan:在动手之前先把仓库摸透
repo-intake-and-plan:在动手之前先把仓库摸透


做深度学习论文复现的时候,最怕的是什么?不是代码跑不起来,而是跑起来之前根本不知道要跑什么。

你面对一个陌生的 GitHub 仓库,README 洋洋洒洒写了几千字,里面有训练命令、有推理命令、有评估脚本——但哪个是你当前需要的?哪个是官方推荐的?哪个跑起来最省时间、最不容易出错?这些问题如果不先搞清楚,要么一头扎进去乱试,要么花大量时间通读整个仓库再动手。

repo-intake-and-plan 就是为这个场景设计的。它是 lllllllama 开发的 RigorPilot Skills 套件中的一个子技能,专门负责复现流程中的“信息收集与规划”阶段。截至 2026 年 7 月,它在各个技能平台上的安装量已超过 12.7 万次

这个技能能做什么

repo-intake-and-plan 的核心定位非常明确:在动手之前,先把仓库摸透,然后把最精简的可信复现计划交给主流程

它不是代码生成器,不是环境配置工具,也不是命令执行器。它的全部工作就是“扫描+分类+规划”——读文件、提取命令、分门别类、给出最小可行方案

具体来说,它做以下几件事。

扫描仓库结构和项目文件:技能会读取目标仓库的 README 和常见的项目配置文件。它不依赖外部网络请求,所有操作都是读取本地文件系统,被第三方安全审计评为 SAFE 级别。辅助脚本 scan_repo.pyextract_commands.py 使用 Python 标准库解析文本和列出文件,不调用任何危险的系统调用

提取文档化命令:从 README 和项目文件中提取所有被明确记录的命令。哪些是官方推荐的运行方式、哪些是示例用法、哪些是备选方案——技能会把这些命令从大段文字中剥离出来,形成一份清晰的命令清单

分类候选命令:提取出来的命令会被归入四个类别——推理(inference)、评估(evaluation)、训练(training)和其他(other)。分类遵循保守原则:不确定的就不乱归类。比如一个命令如果既可能用于推理也可能用于评估,技能会把它标记为“其他”或“不明确”,而不是强行塞进某个类别里。

生成最小可信复现计划:在所有提取和分类完成之后,技能会输出一份尽可能精简的复现建议。这份计划不追求面面俱到,只给出当前信息下最可靠、代价最小的执行路径——比如“先用推理命令跑通,再去考虑训练”。

列出模糊点和风险:技能还会明确指出当前信息中哪些地方存在歧义或风险。比如 README 里没有写清楚某个命令的依赖版本,或者某个脚本的输入输出格式没有说明——这些都会被列出来,提醒你在执行之前先把坑填上。

安装方法

repo-intake-and-plan 支持 Claude Code、Codex、Cursor 等多种 AI 编程助手

通过 npx skills 安装(推荐)

在项目根目录打开终端,执行以下命令:

bash
npx skills add https://github.com/lllllllama/rigorpilot-skills --skill repo-intake-and-plan

指定 Agent 安装

如果只想为某个特定的 AI 助手安装,可以用 --agent 参数指定:

bash
npx -y skills add lllllllama/rigorpilot-skills --skill repo-intake-and-plan --agent claude-code

这条命令会把技能安装到当前项目的 .claude/skills/ 目录下

通过 skill4agent 安装

bash
npx skill4agent add lllllllama/rigorpilot-skills repo-intake-and-plan

通过 bzskills 安装

bash
npx bzskills add lllllllama/ai-paper-reproduction-skill --skill repo-intake-and-plan

前置条件

  • Node.js 环境(版本 ≥ 18)

  • 一个支持 skills 的 AI 编程助手

  • 目标仓库的本地路径

安装完成后,技能文件会存放在对应目录下(如 .claude/skills/.cursor/skills/)。重启 AI 编程助手即可生效。

什么时候该用它

repo-intake-and-plan 的使用边界非常清晰,文档里写得明明白白。

应该使用的情况

  • 在 README-first 复现工作的最开始阶段

  • 主编排器(orchestrator)需要快速获取仓库结构和文档化命令的概览

  • 推理、评估、训练候选命令需要被保守地分类

  • 用户明确表示想先检查仓库,暂时不执行任何操作

  • 目标是一个深度学习论文的代码仓库,需要做复现

不应该使用的情况

  • 执行已经开始,当前任务变成了运行命令或写输出

  • 目标不是一个仓库驱动的复现任务

  • 用户只想解读论文,不需要检查仓库

  • 用户已经选定了某个文档化命令,只需要环境配置或执行

  • 环境设置、资源下载、命令执行、最终报告、论文查阅、端到端编排——这些都不归它管

使用案例

案例一:刚拿到一个新仓库,不知道从哪下手

你从某个论文页面上下载了一个深度学习仓库的代码,README 有 2000 多字,里面夹杂着训练命令、推理示例、评估脚本、Docker 构建指令——信息量很大但毫无头绪。你告诉 AI 助手:“帮我扫描一下这个仓库,告诉我最可靠的复现路径是什么。”

repo-intake-and-plan 被调用后,会读取 README 和项目文件,提取所有文档化命令,分类整理,然后返回一份简洁的复现计划。输出大致是这样的:仓库结构摘要 → 文档化命令清单 → 候选分类(推理/评估/训练/其他)→ 最小可信复现建议 → 模糊点和风险列表。你不需要通读 2000 字的 README,直接看这份计划就知道该怎么动手了。

案例二:多个命令都能跑,不知道选哪个

仓库的 README 里写了三种运行方式:python infer.pypython eval.pypython train.py。你当前的任务只是验证论文的推理结果,不需要从头训练。但你不确定 infer.pyeval.py 哪个是你要的——它们的名字看起来差不多。

技能会帮你区分:infer.py 被归类为“推理”,eval.py 被归类为“评估”,train.py 被归类为“训练”。然后根据你的优先级(比如“推理优先”),推荐最精简的路径——先跑 infer.py。如果你告诉助手“我只想验证论文的推理结果”,计划里可能压根不会提到训练命令。

案例三:README 说得不清不楚

你读完了 README,但某个关键命令的输入输出格式没有说明,或者某个步骤的依赖版本含糊其辞。你让 AI 助手扫描仓库。

技能在输出复现计划的同时,会列出一个“模糊点和风险列表”。比如:“python run.py --model xxx--model 参数可选值在 README 中未说明,建议查看 run.py 的 argparse 定义。”这个列表让你在真正动手之前就知道哪些地方需要额外留意,而不是跑到一半卡住了再回头查。

案例四:作为更大复现流程的第一步

你正在用 RigorPilot 的完整复现流程(ai-research-reproduction)处理一个论文仓库。主编排器在流程最开始调用 repo-intake-and-plan 完成信息收集,拿到仓库结构摘要和命令分类结果之后,再决定后续调用哪些子技能——paper-context-resolver 去查论文细节、环境配置技能去装依赖、执行技能去跑命令。repo-intake-and-plan 在整个流程中只负责一件事:在动手之前把信息摸清楚

几个值得注意的细节

只扫不跑,严格只读:这是 repo-intake-and-plan 最核心的边界。它不装环境、不下资源、不跑命令、不做高风险补丁。所有操作都是只读的——读文件、列目录、解析文本。它输出的是一份计划,不是执行结果。被第三方安全审计评为 SAFE 级别

辅助层技能,通常由编排器调用:repo-intake-and-plan 不是一个独立完成任务的端到端技能。它通常被更大的复现流程(如 ai-research-reproduction)在需要的时候调用。你也可以在对话中直接要求使用它,但它的输出通常需要配合其他技能才能完成完整的复现工作。

安装后 slug 保持不变:技能安装后的标识符保持为 repo-intake-and-plan,便于兼容和引用

不替代人工判断:技能输出的“最小可信复现计划”是基于 README 和项目文件的保守推荐。如果 README 本身信息不足或有误,技能只能如实列出模糊点和风险,最终的决策权还是在人手里。