メタ説明(154): z、t、カイ二乗、またはF統計量からp値を計算します。P値計算機はアルファ値と比較して、5つのよくある誤読を説明します。
スキーマ: WebApplication + FAQPage + BreadcrumbList
P値計算機は、検定統計量をz、t、カイ二乗、またはF検定のp値に変換し、検定が許可する場合は片尾または二尾の選択肢があります。統計量、必要に応じて自由度、そして尾の選択を入力します。計算機はp値を返し、選択したαと比較し、尾面積プロット上のリジェクション領域をシェーディングします。
p値が答えます:もし帰無仮説が真なら、少なくともこの極端なデータが偶然にどれくらいの頻度で現れるのか?帰無仮説が真かどうかは答えていません。この区別が下記の誤解セクションの原因となっています。
検定統計量からp値を計算します
サポートされる入力は、z、t(自由度)、カイ二乗(自由度)、F(分子と分母)です。テスト出力の統計量を入力します。電卓はそれをマッチングの参照分布にマッピングし、末尾確率を返します。
zとtの場合、数値を読む前に一尾または二尾に設定し、陰影が仮説に合うようにします。
zとtの場合は、数字を読む前に片側または二側を選びます。カイ二乗検定とF検定は、入門コースで教わる形式では通常片側(上尾)です。インターフェースもそれを反映しています。
片側検定か両尾検定を選びましょう
両側検定は統計量が帰無値とどちらの方向とも異なっているかを問い、対称のz検定とt検定では一つの尾面積が小さいのを2倍にします。一方尾検定は、名前のある方向についてのみ問います。
データを見る前に研究計画が方向性を決めない限り、両側を用いてください。符号の半分pを観察した後に切り替え、偽陽性を増幅させます。
データを見る前に研究計画が方向性を決めない限り、両側仮説を用いてください。符号を観察した後に片側仮説に切り替えるとp値が半分になり、偽陽性が増大します。方向仮説はプロトコルに含まれており、0.06の事後的な救済には含まれません。
p値とアルファを比較してください
アルファはあらかじめ選ばれた有意水準で、しばしば0.05、時には0.01や0.10となります。pがアルファ以下なら帰無仮説を棄却します。pがアルファより大きい場合は棄却しない。棄却失敗は帰無仮説を真であることを証明することとは異なります。
この研究は単に力が不足しているのかもしれません。だからこそ、区間や効果量は二元的な判断の隣に置かれるべきです。
- p ≤ α なら、帰無仮説を却下します。
- p > α なら、帰無仮説を拒否できない。
「拒否失敗」は「無効を証明する」とは違います。単に研究の力が不足しているのかもしれません。結果の横に値を付けると、計算機は比較αハイライトを表示します。
zから二側のp値を2.0と等しく計算します。
zが2.0の場合、両側正規検定において2.0の上の一つの尾面積は約0.0228です。その面積を2倍すると、二側のp値は約0.0455となります。α 0.05に対しては、その結果は帰無を否定します。α 0.01に対しては否定しません。データはこれら2つの判定間で変わっていません。変わったのは閾値だけです。
1。 2.0 ≈ 0.0228(より正確には0.02275)の上にある一尾の領域。 2。 二尾のp = 2 × 0.02275 ≈ 0.0455。 3. αに対して = 0.05: 0.0455 < 0.05 → nullを拒否する。
α = 0.01に対しては、同じp値が却下されません。データは変わっていません。閾値は変わりました。したがって、αはpを見る前に設定され、その後に交渉してはいけません。
尾の面積のプロットを読んでください
プロットは参照密度、検定統計量の垂直線、選定αの陰付きリジェクション領域を示しています。正規曲線上の両側α = 0.05の場合、臨界値は±⟧1.96付近に位置します。いずれかの臨界値を超える統計量は陰に入ります。
陰影の尾が選択されたテスト方向と一致しているか確認してください。上部尾の陰影だけが選択された大きな負の統計量は設定ミスであり、帰無の証拠ではありません。二尾アルファ0.05の正負1.96の臨界値マーカーは、数値pに対する2回目の視覚的チェックを提供します。
統計線が陰影なしの中心内に位置し、pが報告されている場合、視覚と数値は一致します:そのαで拒否できません。プロットを使って符号の誤差(上部の尾の陰影のみが選ばれた大きな負のz)を合理性チェックします。
p値が何を意味しないのか理解しましょう
5回の誤読が主な誤りであり、それぞれが以下に説明する特定の理由で誤っています。p値は帰無モデルにおける尾部確率であり、仮説が正しい直接確率ではなく、効果サイズでも再現確率でもありません。0.05カットオフは慣習であり、有意でない結果は効果がない証明ではありません。
1。p値は帰無仮説が真である確率ではありません。 帰無仮説が真である場合に、少なくともこの極端なデータが得られる確率です。これらは異なる条件付けです。混同すると、尾の確率が仮説への直接的な賭けに変わります。
2。p値は効果サイズではありません。 十分なサンプル数で、些細な差はp < 0.05に達します。別途平均差、リスク比、または標準化された効果を報告してください。小さなpを「大きな効果」として扱わないでください。
3。p値は再現確率ではありません。pが0.03であっても、繰り返し研究が同じ結果が得られる確率が97%であることを意味しません。再現性は検出力、真の効果量、研究デザインに依存します。
4。0.05の閾値は慣習であり、自然法則ではありません。 p = 0.049 と p = 0.051 はほぼ同一の証拠です。ジャーナルの習慣を「重要」と「非」に二分しても、データに明確な線引きはできません。
5。有意でないとは「効果なし」ではありません。 αに達しなかったことは、研究が検出力不足だった可能性があります。証拠の欠如は欠如の証拠ではありません。無知を主張する前に信頼区間と検密度を確認してください。
これらの点は、アメリカ統計学会の2016に関するp値に関する記述と一致しています。電卓は依然としてpとαを比較します。なぜなら、そのワークフローが授業や多くのプロトコルで求められているからです。上記のセクションが、数値が読みすぎないようにしています。
選ばれたアルファの臨界値を読み上げる
臨界値は、選択したアルファ・テール・ルールに一致する統計尺度上のカットオフです。二尾正規検定の場合、1.645(0.10)、1.960(0.05)、2.576(0.01)のカットオフです。絶対zが臨界値(pがアルファ以下に相当)を超える場合は却下します。
t検定の場合、カットオフは自由度にも依存します。
| α | 重要な点 | z | |
|---|---|---|---|
| 0.10 | 1.645 | ||
| 0.05 | 1.960 | ||
| 0.01 | 2.576 |
| z |
|---|
通常のトラップを使わないp値を報告する方法
ソフトウェアが提供した正確なpを報告してください。星や「p is below 0.05」バッジだけでなく。効果量や信頼区間を組み合わせて、読者が大きさを判断できるようにします。研究が確認的な分析計画では、アルファおよび一側対二側のルールに事前にコミットしてください。
探索的解析もp値を示しますが、探索的とラベル付けすべきです。複数の未調整検定は少なくとも1つの偽陽性の可能性を誇張させます。この問題はこの計算機では解決できず、符号を見てから静かに両側から一側に切り替えても解決しません。
よくある質問
p値とは何ですか?
p値は、帰無仮説の下で、観測された統計量と同等以上の極端な検定統計量を得る確率です。pが小さいほど、そのモデルにおけるデータは帰無と互換性が低いことを意味します。
アルファとは何でしょうか?
アルファ(α)は、リジェクト/失敗のカットオフとして用いられるあらかじめ選択された有意水準で、一般的に0.05です。これは誤差制御のためのポリシー選択であり、発見された定数ではありません。
片側検定を使うべきか、それとも両側検定を使うべきか?
データを見る前に方向仮説が指定されていない限り、両側検定を用いてください。一方側検定は「合格」しやすく、事後に誤用されることが多いです。
p = 0.049 は p = 0.051 と意味のある違いがあるのでしょうか?
いいえ。証拠の強さはほぼ同じです。0.05の明確な線は従来通りです。
有意なp値は研究仮説を証明するのでしょうか?
いいえ。モデルの仮定に基づき、選択したαでヌルの下で異常なデータを示します。交絡、バイアス、誤ったモデルは依然として起こり得ます。
有意でない結果は効果がないことを証明するのでしょうか?
いいえ。研究には信頼性が欠けているかもしれません。無意味結論を主張する前に、間隔を報告し効果サイズを考慮してください。
どの検定統計量を入力すればよいでしょうか?
手順で生成した統計量を入力します:zは大標本正規検定、tは推定σの平均検定、多くのカテゴリカル検定はカイ二乗、Fは多くの分散比検定です。dfを同じ出力に照合します。
zから二側p値をどのように計算するのですか?
z
ソフトウェア同士でpについて少し意見が食い違うことはありますか?
はい。尾のアルゴリズムと丸めは小数点4位で異なります。最初の2桁での意見の相違は通常、間違った尾や間違ったDF、または間違った分布族を意味します。
まとめ
P値計算機はz、t、カイ二乗、またはFの統計量をp値に変換し、αと比較してリジェクション領域をシェーディングします。二つ尾のz = 2.0はp ≈ 0.0455となり、0.05で却下し、0.01では拒否しません。
p値は帰無が真である確率でも効果大きさでも再現確率でもありません。0.05は慣習であり、非有意性は効果がない証明ではありません。
有意性の判断にはこのページをご利用ください。標準化されたスコアと曲線面積だけが必要な場合はZスコア計算機を使いましょう。