怎么运行检查
- 01选择一个面板从标签栏选择或打开其地址;四个面板共用一套判定语言。
- 02输入主张。表达式等价接受表达式 A 和 B;答案核对接受题目、你的答案和变量,还可选做量纲检查。
- 03粘贴证据,而不是散文。数据判异接受一列用逗号、空格或换行分隔的数值。数字复核接受 N、M、SD 和小数位数,然后接受 t、df 与报告的 p;两组的 N/M/SD 会重算独立样本 t。
- 04运行检查用面板按钮执行;输入过期时不会计算。
- 05读卡片判定、信任徽章、方法、证据与警告,需要时加入报告。
算例
下面的每个数字都来自各面板的演示输入;按一下检查按钮即可复现。
| 面板 |
输入 |
读数 |
| 表达式等价 |
x^2 - 1 ≟ (x-1)(x+1) |
✓ 等价,精确 —— A−B 结构化简为 0;32/32 个抽样点一致 |
| 答案核对 |
x^2 - 5x + 6 = 0,答案 x=2, x=3 |
✓ 正确,已验证 —— 两个根残差均为 0;引擎参考 x = 2, x = 3 |
| 数据判异 |
SPC 演示,11 个值,以 15 结尾 |
✗ 不通过(4 条触发):CL 10.4727,UCL 12.3338,LCL 8.61165,σ̂ 0.620359;第 11 点在 z = 7.30;中心线下方两段连续 9 点 |
| 数字复核 |
N 28,M 4.63,SD 1.21,2 位小数 |
GRIM 不可能 —— 最近值 4.64 / 4.61;SD 无法评估;t(27) = 2.31,p = 0.03 读作双侧 0.0288 |
两组六个字段(n₁ = 28,M₁ = 4.63,SD₁ = 1.21;n₂ = 26,M₂ = 3.94,SD₂ = 1.12)给出 t(52) = 2.1698,p = 0.0346。
三种判定,四级信任
判定把"否"与"未证明"分开。不通过需要一个明确的反证 —— 反例点、超出容差的残差、被标记的控制点。通过需要现有最强的证据。条件成立覆盖中间地带:一侧定义域不同、没有任何证明能到达的恒等式、缺失的根、小到无法判断的样本。信任徽章描述方法:精确是符号或精确有理数运算,已验证是带残差或见证的数值结果,近似是未量化的浮点,启发式是无法证明任何结论的抽样。仅凭数值一致永远得不到"等价":x + 1e12 与 x + 1e12 + 1 在 32/32 个点上一致,仍读作未证实。
上限与范围
- 输入与规模上限。
- I-MR 控制图至少需要 3 个观测;Anderson–Darling 正态性检验至少需要 8 个,且拒绝零方差;参考区间检查要求上限高于下限。当 N ≥ 10^decimals 时 GRIM 完全失去检验力(2 位小数下的 28 没问题),简版 GRIMMER 在 N = 200 以上跳过。答案核对接受数值根或常数根,只有在引擎真正解方程时才确认"无实数解"。接近 10¹² 时,真实的 +1 差距落在抽样分辨率之内,仍然读作未证实。
- 它不做的事:
- 不展示逐步推导,不拟合模型,也不证明报告数据真实 —— GRIM/GRIMMER 与 Nelson 规则检验的是自洽性,不是真实性。逐步求解请用科学计算器;从原始数据做检验与汇总请用统计计算器;研究设计与控制图设置请用应用统计。
残差不是误差
标志性陷阱是巨大尺度上的极小残差。对 100000x = 1e12 回答 x = 1e7+1 时,原始残差是 100000;相对 10¹² 的局部尺度归一化为 1.0e-7 —— 落在 1e-6 的残差容差之内,所以只看残差的检查会接受这个答案。第二条路径把残差换算成变量空间的误差,即 Newton 步长 |f(x̂)/f′(x̂)| = 1,远超 0.01 的上限;卡片读作错误,并报告缺失的根 10000000。舍入的处理不同:3x = 1 回答 x = 0.333333333 以根误差 3.333e-10 通过,而 x = 0.33 以残差 0.01、根误差 0.003333 失败。|f(x̂)| 小并不等于 x 的误差小。
典型使用场景
批改或检查一个解
(x-6)/(x-6) 化简为 1,但只是条件等价:在 x = 6 处只有右侧有定义。答案核对给出每个根的证据 —— x=2, x=3 读作残差 0,而只有 x=2 时会漏掉根 3 —— 且 d/dx(x³ + sin x) = 3x² + cos x 是精确的。
筛查一列数据
SPC 演示的尖峰被三种方式抓到:UCL 12.3338,第 11 点在 z = 7.30,中心线下方两段连续 9 点。干净的 12 值样本通过正态性(p = 0.995,小样本警告);追加 25 后在第 20 点失败(A²* = 6.93,p = 5.82e-17),z = 4.25。
审查论文里的数字
数字复核的默认值已经过不了 GRIM —— N = 28 无法四舍五入到 M = 4.63 —— 这也挡住了 SD 检查。t(27) = 2.31、p = 0.03 与双侧一致(0.0288),但当作单侧 p = 0.045 来读会偏差 0.0306,超出 0.005 的容差。
隐私
四个面板全部在你的浏览器内计算;你输入或粘贴的任何内容都不会上传。
参考与延伸
- Brown N.J.L. & Heathers J.A.J.,The GRIM test,Social Psychological and Personality Science 8(4):363–369 (2017),doi.org (访问日期:2026-10-01)——报告均值的粒度限制。
- Anaya J.,The GRIMMER test,PeerJ Preprints 4:e2400v1 (2016),doi.org (访问日期:2026-10-01)——SD 的可行性。
- Nelson L.S.,The Shewhart Control Chart — Tests for Special Causes,Journal of Quality Technology 16(4):237–239 (1984),doi.org (访问日期:2026-10-01)——八条检出规则。
- NIST/SEMATECH,e-Handbook of Statistical Methods,§6.3.1 What are Control Charts?,itl.nist.gov (访问日期:2026-10-01)——3σ 控制限。
- NIST/SEMATECH,e-Handbook of Statistical Methods,§1.3.5.14 Anderson-Darling Test,itl.nist.gov (访问日期:2026-10-01)——正态性检验。
- NIST/SEMATECH,e-Handbook of Statistical Methods,§1.3.6.6.4 t Distribution,itl.nist.gov (访问日期:2026-10-01)——尾部概率。
本页计算器
精选工具,点开即用;小工具可直接试算,数值会带入完整计算器。
来源与审阅
- 更新
- Brown N.J.L. & Heathers J.A.J.,GRIM 检验:一种简单技术可发现心理学结果报告中的大量异常,Social Psychological and Personality Science 8(4):363–369 (2017)(访问日期:2026-10-01)
- Anaya J.,GRIMMER 检验:检验报告变异度指标有效性的方法,PeerJ Preprints 4:e2400v1 (2016)(访问日期:2026-10-01)
- Nelson L.S.,The Shewhart Control Chart — Tests for Special Causes,Journal of Quality Technology 16(4):237–239 (1984)(访问日期:2026-10-01)
- NIST/SEMATECH,e-Handbook of Statistical Methods,§6.3.1 什么是控制图?(访问日期:2026-10-01)
- NIST/SEMATECH,e-Handbook of Statistical Methods,§1.3.5.14 Anderson-Darling 检验(访问日期:2026-10-01)
- NIST/SEMATECH,e-Handbook of Statistical Methods,§1.3.6.6.4 t 分布(访问日期:2026-10-01)