如何规划研究
- 01选择与设计匹配的检验。两个独立均值是
tTwo;配对测量是带 d<sub>z</sub> 的 tPaired;比例是带 h 的 propTwo。 - 02选择要求解的项。功效、N 或效应——另外两个必须提供。
- 03用检验自身的单位输入效应。d = 0.5 是半个标准差;h = 0.541 是反正弦变换后的比例差。面板在约定之间换算(d ↔ r、η² ↔ f、比例 ↔ h),因此效应可以用来源所用的形式表述。
- 04设置 α、尾数和任何校正。双侧 α = 0.05 是默认值;对 k 个比较的 Bonferroni 或 Šidák 校正会在功效计算前作用于有效 α。
- 05读取分布卡片。功效、N(拆分为 n₁ 和 n₂)、临界值、df 和非中心参数 δ 都会报告,这正是数字可审计的原因。
计算读数
| 设计 · 输入 |
读数 |
| 双样本 t,d = 0.5,α = 0.05,80 % 功效,双侧 |
N = 128(64 + 64),功效 80.146 %,临界 t 1.978971,df 126,δ 2.82843 |
| 同一设计,单侧 |
N = 101(51 + 50),功效 80.241 %,临界 t 1.660391,df 99 |
| 同一设计在 N = 100 |
功效 69.689 %(δ 2.5,临界 t 1.984467,df 98) |
| 在 N = 100 求效应 |
最小可检测 d = 0.56588 |
| 目标 90 % 功效 |
N = 171(86 + 85),δ 3.26912 |
| d = 0.2 代替 0.5 |
N = 787(394 + 393) |
| 2 个比较的 Bonferroni |
有效 α 0.025,N = 155(78 + 77) |
| 双比例,h = 0.541 |
N = 108(54 + 54) |
| A/B:120/1000 对 150/1000 |
z 1.96305,p 0.04964,显著;观测率下的后验功效 50.203 %;按该率 80 % 功效每组需 2036 |
为什么答案来自非中心分布
在零假设下,双样本 t 统计量服从自由度为 126 的中心 t 分布,检验在 |t| 超过 1.978971 时拒绝。在备择假设下,它服从相同 df 的非中心 t,非中心度 δ = d·√(n₁n₂/(n₁+n₂)) = 2.82843(d = 0.5,每臂 64)。功效是来自这个移位分布的抽样落在临界值之外的概率——80.146 %。计算中没有经验法则:它积分非中心密度,面板报告 δ 和临界值,使结果可复现。
同一套机制在另外两个方向上求逆。求 N 时,求解器增大 n 直到非中心概率越过目标;从 128 到 171 个观测换 90 % 功效,就是额外保障的代价。求最小可检测效应时,它搜索在固定 N 下恰好给出目标功效的效应;在 N = 100 时是 d = 0.56588,所以设计无法可靠地看见它本为之定尺寸的 d = 0.5 效应。单侧一行显示了方向性假设的杠杆:同样的 80 % 功效只需 101 个观测而不是 128,而两个比较的 Bonferroni 校正把 N 提高到 155。
限制与边界
- 功效是设计的属性,不是数据的属性。
- 数字描述的是在假定效应下未来实验的概率;数据到手后,功效不是可观测的统计量。A/B 视图的事后数字是诊断,不是证据。
- 每个答案都继承假定的效应和分布。
- 来自预试验的 d = 0.5 是带有自身不确定性的估计;双比例检验假定反正弦近似,而在离散性重要的小样本单比例研究中可用精确二项功效。
观测功效陷阱
A/B 例子把陷阱浓缩成一张表:120/1000 对 150/1000 给出 z = 1.96305、p = 0.04964,在 α = 0.05 下显著,但在这些观测率下的事后功效只有 50.203 %——像抛硬币。结果并没有错;它很脆弱。把事后功效当作对发现的验证来引用,是把零假设下数据的概率与未来研究的概率混为一谈。诚实的做法是为下一项研究定尺寸:按这些率,80 % 功效每组需要 2036。
第二个陷阱是效应的单位。d = 0.5 和 h = 0.541 按各自约定都算"中等",但不能互换;把换算用到错误的检验上会改变所需的 N。第三个是离散性:对 n = 30、p₀ = 0.25、p₁ = 0.5 的精确二项例子,名义 α = 0.05 只容许整数拒绝域 X ≤ 2 或 X ≥ 13,其实际双侧大小为 α = P(X ≤ 2 或 X ≥ 13 | p₀) = 0.032190,功效则是同一拒绝域在 p₁ = 0.5 下的概率 81.920 %。n 小时,要读实际 α,而不是你输入的那个。
它适合哪里
为两臂实验定尺寸
对于半个标准差的效应、双侧 80 % 功效,答案是 128 个观测;把保障加倍到 90 % 需要 171,校正两个比较需要 155。每个数字都带有 δ 和临界值,审阅者可以核对算术。
正确解读功效不足的结果
每臂 50、d = 0.5 的预试验功效为 69.7 %,所以不显著的结果并不是无效应的证据——它是十次运行中三次的预期结果。"求效应"把它变成具体陈述:该预试验只能可靠检测 d = 0.566 及以上。
隐私
所有功效计算、曲线和 A/B 结果都在你的浏览器中计算;不会上传任何内容。
参考文献
- Wikipedia, Power of a test, en.wikipedia.org (访问日期:2026-10-07)——功效、β 与设计解读。
- Wikipedia, Noncentral t-distribution, en.wikipedia.org (访问日期:2026-10-07)——t 检验功效背后的移位分布。
- Wikipedia, Sample size determination, en.wikipedia.org (访问日期:2026-10-07)——对 N 和效应量的功效求逆。
- Wikipedia, Bonferroni correction, en.wikipedia.org (访问日期:2026-10-07)——应用于 α 的多重性校正。
- G*Power (Faul et al., 2007), psychologie.hhu.de (访问日期:2026-10-07)——非中心分布功效分析的参考工具。
本页计算器
精选工具,点开即用;小工具可直接试算,数值会带入完整计算器。