So führen Sie eine Prüfung aus 01 Ein Panel wählen aus der Tableiste oder seine Adresse öffnen; die vier Panels teilen eine Urteilssprache. 02 Die Behauptung eingeben. Äquivalenz nimmt Ausdrücke A und B; Antwortprüfung nimmt eine Aufgabe, Ihre Antwort und die Variable, dazu eine optionale Dimensionsprüfung. 03 Evidenz einfügen, keine Prosa. Datenprüfung nimmt eine numerische Spalte, getrennt durch Kommas, Leerzeichen oder Zeilenumbrüche. Zahlen-Audit nimmt N, M, SD und Dezimalstellen, dann t, df und berichtetes p; die N/M/SD zweier Gruppen berechnen den unabhängigen t neu. 04 Die Prüfung starten mit der Panel-Schaltfläche; bei veralteter Eingabe passiert nichts. 05 Die Karte lesen Urteil, Vertrauensstufe, Methode, Evidenz und Warnungen, dann nach Bedarf zum Bericht hinzufügen.
Rechenbeispiele Jede Zahl unten stammt aus den Demo-Eingaben der Panels; drücken Sie eine Prüfschaltfläche, um sie zu reproduzieren.
Panel
Eingabe
Ausgabe
Equivalence
x^2 - 1 ≟ (x-1)(x+1)
✓ Äquivalent, Exakt — A−B vereinfacht sich strukturell zu 0; 32/32 Stichprobenpunkte stimmen überein
Answer Check
x^2 - 5x + 6 = 0, Antwort x=2, x=3
✓ Korrekt, Verifiziert — Residuum 0 für beide Wurzeln; Engine-Referenz x = 2, x = 3
Data Check
SPC-Demo, 11 Werte, endend auf 15
✗ Nicht bestanden (4 Auslösungen): CL 10.4727 , UCL 12.3338 , LCL 8.61165 , σ̂ 0.620359 ; Punkt 11 bei z = 7.30 ; zwei 9-Punkte-Läufe unter der Mittellinie
Number Audit
N 28 , M 4.63 , SD 1.21 , 2 Dezimalstellen
GRIM unmöglich — am nächsten 4.64 / 4.61 ; SD nicht bewertbar; t(27) = 2.31, p = 0.03 liest 0.0288 zweiseitig
Alle sechs Zwei-Gruppen-Felder (n₁ = 28, M₁ = 4.63, SD₁ = 1.21; n₂ = 26, M₂ = 3.94, SD₂ = 1.12) ergeben t(52) = 2.1698 , p = 0.0346 .
Drei Urteile, vier Vertrauensstufen Das Urteil trennt „Nein“ von „nicht bewiesen“. Nicht bestanden braucht einen expliziten Zeugen — einen Gegenbeispielpunkt, ein Residuum jenseits der Toleranz, einen markierten Regelpunkt. Bestanden braucht die stärkste verfügbare Evidenz. Bedingt deckt die Mitte ab: Definitionsbereiche, die auf einer Seite abweichen, eine Identität, die kein Beweis erreicht, eine fehlende Wurzel, eine zu kleine Stichprobe für eine Entscheidung. Die Vertrauensstufe beschreibt die Methode: Exakt ist symbolische oder exakt-rationale Arbeit, Verifiziert ist ein numerisches Ergebnis mit Residuum oder Zeugen, Approximation ist unquantifiziertes Gleitkomma, Heuristisch ist Stichprobenarbeit, die nichts beweisen kann. Numerische Übereinstimmung allein erlangt nie Äquivalent: x + 1e12 und x + 1e12 + 1 stimmen in 32/32 Stichproben überein und lesen trotzdem Nicht bestätigt.
Obergrenzen und Umfang
Eingabe- und Größenobergrenzen. I-MR-Karten brauchen mindestens drei Beobachtungen; Anderson–Darling-Normalität braucht mindestens acht und lehnt Varianz null ab; Referenzintervall-Prüfungen brauchen eine Obergrenze über der Untergrenze. GRIM verliert jede Power, sobald N ≥ 10^decimals (28 ist bei 2 Dezimalstellen in Ordnung), und das vereinfachte GRIMMER überspringt oberhalb von N = 200. Antwortprüfung akzeptiert numerische oder konstante Wurzeln und bestätigt „keine reelle Lösung“ nur, wenn die Engine die Gleichung löst. Nahe 10¹² liegt eine echte +1-Lücke innerhalb der Stichprobenauflösung und bleibt Nicht bestätigt. Was sie nicht tut: Sie zeigt keine Schritt-für-Schritt-Herleitungen, fittet keine Modelle und beweist nicht, dass berichtete Daten echt sind — GRIM/GRIMMER und die Nelson-Regeln testen Selbstkonsistenz, nicht Authentizität. Für Schritt-für-Schritt-Lösungen nutzen Sie den Wissenschaftlichen Rechner ; für Tests und Zusammenfassungen aus Rohdaten den Statistik-Rechner ; für Studiendesign und Regelkarten-Einrichtung die Angewandte Statistik .
Das Residuum ist nicht der Fehler Die eigentliche Falle ist ein winziges Residuum auf riesiger Skala. Für 100000x = 1e12 mit der Antwort x = 1e7+1 ist das rohe Residuum 100000 ; gegen die lokale Skala von 10¹² normalisiert es sich zu 1.0e-7 — innerhalb der Residuumstoleranz von 1e-6, sodass eine reine Residuumprüfung die Antwort akzeptieren würde. Der zweite Arm wandelt das Residuum in einen Fehler im Variablenraum um, den Newton-Schritt |f(x̂)/f′(x̂)| = 1 , weit jenseits der Obergrenze von 0.01 ; die Karte liest Falsch und meldet die fehlende Wurzel 10000000 . Rundung wird anders behandelt: 3x = 1 mit der Antwort x = 0.333333333 besteht mit einem Wurzelfehler von 3.333e-10 , während x = 0.33 mit Residuum 0.01 und Wurzelfehler 0.003333 durchfällt. Ein kleines |f(x̂)| ist kein kleiner Fehler in x.
Wobei es hilft Eine Lösung bewerten oder prüfen (x-6)/(x-6) vereinfacht sich zu 1, ist aber nur bedingt äquivalent: Bei x = 6 ist nur die rechte Seite definiert. Antwortprüfung liefert Evidenz pro Wurzel — x=2, x=3 liest Residuum 0, während x=2 allein die Wurzel 3 vermissen lässt — und d/dx(x³ + sin x) = 3x² + cos x ist Exakt.
Eine Datenspalte screenen Der Ausreißer der SPC-Demo wird dreifach gefangen: UCL 12.3338 , Punkt 11 bei z = 7.30, zwei 9-Punkte-Läufe unter der Mittellinie. Eine saubere Stichprobe mit 12 Werten besteht die Normalitätsprüfung (p = 0.995 , Warnung bei kleiner Stichprobe); hängt man 25 an, fällt sie durch (A²* = 6.93 , p = 5.82e-17 ) bei Punkt 20, z = 4.25.
Die Zahlen eines Papers auditieren Die Standardwerte des Zahlen-Audits scheitern bereits an GRIM — N = 28 kann nicht auf M = 4.63 runden — was auch die SD-Prüfung blockiert. t(27) = 2.31 mit p = 0.03 ist zweiseitig konsistent (0.0288), aber als einseitiges p = 0.045 gelesen liegt es um 0.0306 daneben, jenseits der Toleranz von 0.005.
Datenschutz Alle vier Panels rechnen in Ihrem Browser; nichts, was Sie tippen oder einfügen, wird hochgeladen.
Quellen und weiterführende Literatur
Brown N.J.L. & Heathers J.A.J., The GRIM test , Social Psychological and Personality Science 8(4):363–369 (2017), doi.org (访问日期:2026-10-01)— Granularitätsgrenzen bei berichteten Mittelwerten.
Anaya J., The GRIMMER test , PeerJ Preprints 4:e2400v1 (2016), doi.org (访问日期:2026-10-01)— Machbarkeit der SD.
Nelson L.S., The Shewhart Control Chart — Tests for Special Causes , Journal of Quality Technology 16(4):237–239 (1984), doi.org (访问日期:2026-10-01)— die acht Erkennungsregeln.
NIST/SEMATECH, e-Handbook of Statistical Methods , §6.3.1 What are Control Charts?, itl.nist.gov (访问日期:2026-10-01)— 3σ-Grenzen.
NIST/SEMATECH, e-Handbook of Statistical Methods , §1.3.5.14 Anderson-Darling Test, itl.nist.gov (访问日期:2026-10-01)— Normalitätstests.
NIST/SEMATECH, e-Handbook of Statistical Methods , §1.3.6.6.4 t Distribution, itl.nist.gov (访问日期:2026-10-01)— Tail-Wahrscheinlichkeiten.
本页计算器
精选工具,点开即用;小工具可直接试算,数值会带入完整计算器。
来源与审阅
更新 2026-10-01 Brown N.J.L. & Heathers J.A.J., Der GRIM-Test: Eine einfache Technik erkennt zahlreiche Anomalien bei der Berichterstattung von Ergebnissen in der Psychologie, Social Psychological and Personality Science 8(4):363–369 (2017) (accessed 2026-10-01) Anaya J., Der GRIMMER-Test: Eine Methode zur Prüfung der Validität berichteter Variabilitätsmaße, PeerJ Preprints 4:e2400v1 (2016) (accessed 2026-10-01) Nelson L.S., The Shewhart Control Chart — Tests for Special Causes, Journal of Quality Technology 16(4):237–239 (1984) (accessed 2026-10-01) NIST/SEMATECH, e-Handbook of Statistical Methods, §6.3.1 Was sind Regelkarten? (accessed 2026-10-01) NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.14 Anderson-Darling-Test (accessed 2026-10-01) NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.6.6.4 t-Verteilung (accessed 2026-10-01)