🧪 主要功能:不是跑个测试,而是把实验做“对”

ab-testing解决的核心问题不是“怎么跑一个A/B测试”——市面上做这件事的工具已经够多了。它解决的是“怎么设计一个统计上站得住脚、结果能真正指导决策的A/B测试”

这个技能的工作方式更像一位实验设计顾问,而不是一个执行工具。当你提出一个测试需求时,它会按一套完整的框架来推进:

首先,建立假设。 不是“试试看会发生什么”,而是要求你给出一个可证伪的预测。技能内部提供了一个假设模板——因为[观察/数据],我们认为[改动]会导致[预期结果],面向[受众]。我们将在[指标]上看到这个变化。弱假设像“改按钮颜色可能增加点击”,强假设则是“因为用户在结算页停留超过3秒后流失率上升,我们相信把结算按钮提前到首屏会导致移动端转化率提升至少5%”。

然后,确定样本量和运行周期。 技能会问你当前的基线转化率、周流量,以及多小的提升才值得上线。基于这些输入计算所需的样本量和最少运行周数。它还会主动提醒一些容易被忽略的设计问题——比如按访客随机还是按会话随机,以及用户同时看到两个版本时怎么处理。

接着,搭建分析框架。 技能会生成R或Python的分析代码,并内置平衡性诊断(确保分组可比)和预先注册的分析计划(防止事后挑数据)。数据回来之后,跑一遍代码就能拿到结论。

最后,输出可决策的报告。 不是只给一个p值,而是给出获胜版本、置信区间、提升幅度,以及是否值得全量上线的建议。

🚀 首次安装:两种方式,选一种就行

ab-testing是一个Agent Skill,安装方式取决于你用的AI工具。

方式一:通过Qumge MCP一键接入(推荐)

claude mcp add --transport http qumge https://qumge.com/mcp

运行一次即可。之后直接在Claude Code里说“install the ab-testing skill”,它会自动拉取并写入,不需要离开对话窗口,也不需要API key。

方式二:通过npx手动安装

npx skills add https://github.com/coreyhaines31/marketingskills --skill ab-testing

需要Node.js环境(npx自带)。在你的项目目录下运行即可。安装后,AI Agent会自动检测并使用这个技能。

方式三:手动放入项目

从GitHub克隆或下载coreyhaines31/marketingskills仓库,把SKILL.md文件复制到你的项目目录中,AI Agent同样会自动识别。

🎯 主要应用场景:谁在用,用来干什么

场景一:上线前判断“这个改动值不值得测”

产品经理或增长负责人有一个改动想法,但不确定是否值得投入测试资源。技能会引导你明确基线指标、最小可检测效应和流量条件,帮你判断这个实验是否有足够的统计功效,以及需要跑多久。

场景二:避免统计错误

最常见的A/B测试事故不是工具坏了,而是“中途偷看数据觉得赢了就停”。技能内置了统计严谨性原则:预先确定样本量、不中途停止、坚持预注册的分析方法。它生成的代码里也包含了平衡性诊断和预先注册的分析计划。

场景三:从单次实验到实验体系

如果你不只想跑一个测试,而是想建立一套持续的 experimentation 流程——管理实验积压(backlog)、用ICE评分排优先级、维护实验手册——这个技能也覆盖了“growth experimentation program”层面的需求。

场景四:LLM提示词的A/B对比

除了传统的页面转化测试,这个技能同样适用于比较两个System Prompt或两个模型版本的输出质量,帮助你用统计证据选择更好的那个。

💡 使用帮助:AI会在什么情况下自动调用它

这个技能的触发词覆盖了A/B测试的常见表达:当你说“A/B test”、“split test”、“experiment”、“test this change”、“variant copy”、“multivariate test”、“should I test this”、“which version is better”、“how long should I run this test”、“growth experiments”,技能都会被唤起。

首次使用时技能会问什么

为了让实验设计有据可依,技能在开始前会先了解几件事:你想改进什么?考虑的是什么改动?当前的基线转化率是多少?流量规模多大?有什么技术或时间上的约束?如果你的项目里已经有.agents/product-marketing.md.claude/product-marketing.md,技能会优先读取这些上下文,避免重复提问。

技能不做什么

这个技能负责实验的设计和分析,但不负责埋点实现和页面级转化优化。埋点追踪相关的需求,技能会指向analytics;页面级CRO需求,会指向cro。各司其职。

🤖 适合哪些AI工具?

ab-testing是标准的Agent Skill,兼容所有支持SKILL.md机制的AI编程环境:

  • Claude Code:原生支持,通过Qumge MCP安装后可以直接在对话中触发。
  • Cursor:安装后AI会在编写代码或讨论产品改动时自动识别A/B测试相关意图。
  • GitHub Copilot:兼容SKILL.md格式的技能加载。
  • Windsurf、Cline、Aider:均在兼容列表中。

📝 总结

ab-testing的定位很明确:它是“实验设计层”的工具,不是“实验执行层”的工具

它帮你解决的问题是:改动值不值得测、测多久才有结论、怎么保证分组可比、结果出来之后怎么判断该不该上线。这些问题看起来简单,但实际工作中因为统计错误导致的假阳性或假阴性,代价往往比实验本身的成本大得多。

如果你在增长、产品、运营或数据团队,并且已经在用Claude Code或Cursor,这个技能可以让“做实验”这件事从凭感觉变成有方法可循。