「この研究では効果量 d = 0.5 の有意な改善が見られました」——こう書かれた研究を、どう読めばよいのでしょうか。

この問いに答えるには、3つのことを知っておく必要があります。その研究に十分な検出力があったか。その効果量が再現されるか。そして、その分野全体でどれだけの割合の結果が生き残っているか。

スポーツ・運動科学については、いずれにも実測値があります。そして数字は、決して楽観的ではありません。

立川駅徒歩1分年中無休の溶岩ホットヨガスタジオ

再現されるのは4本に1本

Murphy J, et al. Estimating the Replicability of Sports and Exercise Science Research. Sports Medicine. 2025. DOI: 10.1007/s40279-025-02201-w

この分野で初めて、体系的な再現プロジェクトが実施されました。2016年から2021年に第1四分位の学術誌(SCImago 2019年のスポーツ科学分野ランキング)に掲載された応用研究を対象としたものです。選定プロトコルは事前に公表され、志願した協力者が機材と専門性に応じて層別・無作為に研究を割り当てられました。原著者には匿名化された生データの提供、事前登録のレビュー、方法論上の確認が依頼されています。

判定基準は3つでした。

基準
1. 再現研究の結果が統計的に有意である(p < 0.05)
2. 効果の向きが原著と同じである
3. 効果量の大きさが原著と両立する(Z検定で p > 0.05)

解析された25の再現研究のうち、3つの基準すべてを満たして頑健に再現されたのは 7件(28%)だった。

そして著者らは、もうひとつ重要な所見を報告しています。「再現したとき、公表されていた効果量推定値の大きさに実質的な低下があった。したがってスポーツ・運動科学の研究者は、その後の検出力分析を行う際に効果量の不確実性を考慮すべきである。」

この指摘は実務的に重要です。先行研究の効果量を使って必要な標本サイズを計算すると、その効果量自体が過大なので、必要数を過小に見積もることになります。結果として、また検出力不足の研究が生まれます。

著者らはまた、再現研究の実施自体に多くの障壁があったことも記録しています。「原著者とのコミュニケーション、そしてデータと報告の透明性の低さ」です。

典型的な研究の検出力は30%前後

Uehata A, et al. Statistical power analysis in exercise science. Journal of Sports Sciences. 2025. DOI: 10.1080/02640414.2025.2571841

過去5年間に発表された運動科学のメタ分析90件に含まれる個別研究1,191件について、メタ分析で報告された統合効果量を「真の効果量」の近似として用い、各研究の統計的検出力を計算したものです。

「結果は、レビューされた研究の検出力の中央値が 30% という低さでありうることを示している。」

検出力30%とは、真に効果が存在する場合でも、それを検出できる確率が10回中3回という意味です。慣習的な目安は80%です。

著者らは、低い検出力の意味について重要な注意を促しています。「低い統計的検出力は効果を見つける確率を下げるだけだという一般的な解釈とは対照的に、統計的検出力が不十分な研究は、その所見における真の効果を誤解釈しやすく、科学的証拠の完全性を損なう。」

これは直観に反する点です。検出力が低い研究で有意な結果が出た場合、その効果量は真の値より大きく推定されている可能性が高いのです。小さい標本で偶然大きな差が出たときにだけ有意に達するため、公表される効果量が系統的に膨らみます。

なお著者ら自身が「この結果は、将来の確証的研究で厳密に検証されるべきである」と、探索的研究であることを明記しています。

特定の学術誌での実測

Mesquida C, et al. Publication bias, statistical power and reporting practices in the Journal of Sports Sciences: potential barriers to replicability. Journal of Sports Sciences. 2023. DOI: 10.1080/02640414.2023.2269357

同誌の89研究をメタ分析して z曲線分析を行い、さらに174研究で報告慣行を調べたものです。

項目結果
出版バイアス存在の兆候あり
平均観測検出力(有意・非有意を含む)53%
平均観測検出力(有意な所見のみ)61%
事前検出力分析の使用・報告・再現性最適とは言えない
検定統計量・効果量・信頼区間の報告慣行最適とは言えない

著者らは、同誌の以前の編集後記が標本サイズの中央値19と事前検出力分析の乏しい使用を報告していたことにも触れています。

この問題は古くから知られています。1972年の報告では、当時の学術誌に掲載された研究の検出力が小・中・大の効果量に対してそれぞれ 0.15・0.54・0.83 であり「憂慮すべきほど低い(disturbingly low)」とされました。そして1977年・2000年・2020年の同様の研究が、これをおおむね追認しています(Abt ら, 2021, Journal of Sports Sciences)。

同じ編集後記は、この問題の深刻さを端的に述べています。「スポーツ科学における小さな効果は、しばしば勝敗の差と結びついている。したがって、たとえ小さくとも重要な効果を検出できることが、潜在的に重要である。」

立川駅徒歩1分年中無休の溶岩ホットヨガスタジオ

手法を変えても問題は解決しなかった

この分野には、p値への依存から脱却しようとした試みがあります。「大きさに基づく推論(magnitude-based inference, MBI)」です。

Buchheit M. The Numbers Will Love You Back in Return—I Promise. International Journal of Sports Physiology and Performance. 2016. DOI: 10.1123/ijspp.2016-0214

推進側の主張は次のようなものでした。「p値、ひいては研究の結論は、効果の大きさにかかわらず標本サイズに依存する。有意性は効果の大きさを教えてくれないが、最も重要なのは大きさである。MBI は著者が自分の標本サイズについて正直であることを可能にし、些少な効果をよりよく認識させる。」

これは、ここまで述べてきた問題意識と重なります。しかし検証の結果は、厳しいものでした。

Sainani KL. The Problem with “Magnitude-based Inference”. Medicine & Science in Sports & Exercise. 2018. DOI: 10.1249/MSS.0000000000001645

推進側が提供したシミュレーションコードを用いて、第一種・第二種の過誤率を再解析したものです。

「MBI の推進者が主張してきたこととは異なり、MBI は標準的な帰無仮説検定に対して『優れた』第一種・第二種の過誤率を示さない。……MBI の推進者が『最適』とみなす、まさにその小〜中程度の標本サイズにおいて、MBI は第二種の過誤率を下げる代償として第一種の過誤率を大きく膨張させる——標準的な仮説検定の2倍から6倍にである。」

その後、Medicine & Science in Sports & Exercise 誌は MBI を用いた論文を受理しない方針を決定しました。編集長は「この手法について適切に検証された説明が、認知された統計学の学術誌に公表されるまで」MBI を認めないとし、研究者に対してもそれまで使用しないよう推奨しています(Nevill ら, 2018, Journal of Sports Sciences)。

実際にどう使われていたか

Lohse KR, et al. Systematic review of the use of “magnitude-based inference” in sports science and medicine. PLoS ONE. 2020;15(6):e0235318. DOI: 10.1371/journal.pone.0235318

MBI を用いた232論文を系統的にレビューしたものです。

項目結果
標本サイズの中央値(多群研究)1群あたり10名(四分位範囲 8〜15)
標本サイズの中央値(単群研究)14名(四分位範囲 10〜24)
事前の標本サイズ計算を報告15%
臨床的介入を検証していながら「非臨床」設定を選択232論文中、臨床MBIを使ったのは16論文のみ
アウトカムに関する検定の数(中央値)30
主要アウトカムを特定していた論文14%

そして、これらの条件下での第一種の過誤率が推定されています。

MBI の判定基準1群8〜15名のときの第一種の過誤率
「likely(ありそうな)」効果12〜22%
「possible(ありうる)」効果22〜45%

しかも、1論文あたり中央値30の検定が行われ、主要アウトカムを事前に特定していたのは14%だけでした。多重検定による過誤の累積が加わります。

著者らの結論は、この記事の主題そのものです。

「MBI は小規模な研究を促進し、統計に対する『ブラックボックス』的なアプローチを広め、結論がデータに支持されていない多数の論文をもたらしたと結論する。p値と有意性検定の役割をめぐる議論のさなかにあって、MBI は重要な自然実験も提供している。すなわち、研究者を p値や帰無仮説有意性検定から遠ざけることが、二分法的な判断や所見の過剰解釈を減らすという証拠は見出されなかった。」

p値をやめても、二分法的な判断はなくならなかった——これは、この論争から得られる最も重要な教訓かもしれません。

なお、推進側からの反論も存在します。500,000回の無作為化比較試験をシミュレートした研究では、「非臨床MBI の第一種の過誤率は常に帰無仮説有意性検定より低かった」「臨床MBI の第一種の過誤率が高い場合でも、それらの推論の確率的な限定(『ありそうにない』『ありうる』有益性)を考えれば、誤りの大半は議論の余地がある」とされ、MBI は「信頼できる、ニュアンスのある代替手法」と結論されています(Hopkins & Batterham, 2016, Sports Medicine)。この論争は決着していません。

メタ分析も安全ではない

「個別研究は当てにならないが、メタ分析なら大丈夫」——これも成り立ちません。

Kadlec D, et al. With Great Power Comes Great Responsibility: Common Errors in Meta-Analyses and Meta-Regressions in Strength & Conditioning Research. Sports Medicine. 2022. DOI: 10.1007/s40279-022-01766-0

ストレングス&コンディショニング分野で、過去20年間に最も多く引用されたメタ分析20件について、5種類の統計的誤りの頻度を調べたものです。

誤り頻度
何らかの統計的誤りを含む85%(20件中17件)
標準偏差と標準誤差を取り違えて効果量を計算45%
相関のある観測値を考慮していない45%

標準偏差と標準誤差の取り違えがもたらす結果は、深刻です。著者らは「いくつかの事例では、これが明らかに誤った効果量をもたらした。たとえば 11標準偏差 や 14標準偏差 といった効果量である」と報告しています。

効果量 d = 0.8 が「大きい」とされる分野で、d = 11 や d = 14 という値が最も引用されているメタ分析に含まれていた、ということです。

他に指摘された誤りは、ありえない外れ値、研究内分散を考慮しないこと、群間ではなく群内の結果に注目することでした。

特定の領域での実例

Ekkekakis P, et al. Extraordinary Claims in the Literature on High-Intensity Interval Training (HIIT): I. Bonafide Scientific Revolution or a Looming Crisis of Replication and Credibility? Sports Medicine. 2023. DOI: 10.1007/s40279-023-01880-7

高強度インターバルトレーニング(HIIT)に関する2種類の主張——「HIIT は体力と健康の各指標を改善するのに有効である」「HIIT はより時間のかかる中強度持続運動と同じくらい有効である」——を、統計的原則の観点から検討した批判的分析です。

主張の種類指摘された問題
第1の主張(HIIT は有効)小〜中程度の効果を、著しく検出力不足の研究で調べている。小標本に伴う推定値の不安定さに加え、多数の従属変数を第一種の過誤率の膨張を考慮せずに解析している
第2の主張(HIIT は同等)小規模研究の p > 0.05 という基準を、「類似」「同等」の効果を主張するために不適切に用いている

第2の問題は、統計の基本的な誤用です。「差が有意でなかった」ことは「差がない」ことを意味しません。とくに検出力が低い研究では、差があっても検出できないのが当然です。同等性を主張するには、同等性検定という別の手続きが必要になります。

著者らの結論は「HIIT 文献における状況は、心理学における再現性の危機をもたらした研究風土を想起させる。心理学と同様に、これは運動科学における統計実践を改革する機会でありうる」というものでした。

立川駅徒歩1分年中無休の溶岩ホットヨガスタジオ

小標本が何をもたらすか

Knudson D. Confirming Increased Statistical Errors in Testing Correlations from Small Sample Sizes. Measurement in Physical Education and Exercise Science. 2024. DOI: 10.1080/1091367X.2024.2439295

母集団データ(N = 18、230、464)を使い、そこから小標本(n = 10、25、50、100)を無作為抽出して相関分析を行った概念的再現研究です。

所見内容
すべての小標本サイズで6つの対相関と偏相関の検定において1〜3件の第二種の過誤が発生(第一種の過誤はなし)
信頼区間の平均幅.34〜1.08
とくに脆弱な条件小さな真の関連(ρ < .4)を検出できない

相関係数の信頼区間の幅が 1.08 ということは、−1 から +1 までの範囲のうち半分以上を占めるということです。これでは、関連の向きさえ確定できません。

生体力学分野についても、同様の指摘があります。「多くの生体力学研究は小標本サイズと不適切な統計解析を用いており、不正確な推論と効果の大きさの膨張の報告が、この分野では一般的である」(Knudson, 2017, Sports Biomechanics)。スポーツ・運動心理学でも、4つの主要誌の2009〜2013年の全量的研究を解析した結果、「実験研究はしばしば小〜中程度の効果を検出するには検出力不足である」と報告されています(Schweizer & Furley, 2016, Psychology of Sport and Exercise)。

では、どうすればよいのか

この分野は、解決策の提案も行っています。

事前登録と Registered Report

最も効果が大きいと考えられているのが、結果を見る前に査読を受ける形式です。Registered Report では、データ収集の前に方法と解析計画が査読されます。

指標通常の査読Registered Report
帰無所見(null findings)の割合約5〜20%約60%
肯定的所見の割合96%44%

(Abt ら, 2021, Journal of Sports Sciences が引用する Allen & Mehler 2019、Scheel ら 2021 の数値)

この対比は劇的です。通常の文献では96%の研究が「効果があった」と報告しているのに対し、結果を見る前に査読された研究では44%。差の大部分は、出版バイアスと、結果を見てから解析や仮説を調整する慣行によるものと考えられます。

効果量の報告と解釈

Caldwell AR, Vigotsky AD. A case against default effect sizes in sport and exercise science. PeerJ. 2020;8:e10314. DOI: 10.7717/peerj.10314

標準化平均差(SMD)の扱いについて、概念的な枠組みを提示した論文です。著者らは SMD を「大きさに基づくもの」と「信号対雑音に基づくもの」の2種類に二分することを提案しています。

この区別が必要なのは、同じ「d = 0.5」という数字が、何を分母にするかでまったく違う意味を持つからです。群間の標準偏差で割るのか、変化量の標準偏差で割るのか、対照群の標準偏差で割るのか——それぞれ異なる量になります。

著者らの提言は「既定値(デフォルト)の効果量を使うのではなく、生の効果量、SMD、あるいは他の効果量を、自身の研究に合わせて思慮深く報告し、その選択を正当化すること」です。

そもそも効果量を報告すること自体が、まだ徹底されていません。

Tomczak M, Tomczak E. The need to report effect size estimates revisited. An overview of some recommended measures of effect size. Trends in Sport Sciences. 2014;1(21):19–25.

この論文は、効果量を報告する必要性を改めて論じたものです。著者らは「スポーツ科学もこの次善の慣行の手中から完全には逃れられていない。現在の研究報告のなかにさえ、統計解析が p値の計算をあまり超えていないものがある」と指摘しています。

そして問題の核心を、次のように述べています。「p値は変数間の関係の実際の強さについての情報を提供することを意図しておらず、研究者が一方の変数の他方への効果を決定することを許さない。効果量の指標は、この目的によく適う。」

また、パラメトリック検定の後に効果量を報告する研究は着実に増えている一方、ノンパラメトリック検定での効果量の報告は依然として非常に稀であることも指摘されています。

この分野で最も引用されている統計ガイドラインも、同じ方向を向いています。「臨床的・実務的な重要性の評価には不十分な帰無仮説検定よりも、母集団の効果についての推論には推定の精度を用いること」「統計的有意性のための十分な検出力によってではなく、臨床的判断のための許容できる精度あるいは信頼度によって標本サイズを正当化すること」(Hopkins ら, 2009, Medicine and Science in Sports and Exercise)。

読者としてどう読めばよいか

ここまでの知見から、研究の数字を読むときの実践的な指針が導けます。

確認すること理由
標本サイズMBI を用いた232論文で1群の中央値は10名。この規模では小〜中程度の効果を確実には検出できない
信頼区間の幅点推定値より情報が多い。区間がゼロに接している、あるいは極端に広い場合は、実質的に「わからない」
アウトカムの数と、主要アウトカムの事前特定中央値30の検定が行われ、主要アウトカムを特定していたのは14%
「有意差なし」を「同等」と読み替えていないかHIIT 文献で指摘された典型的な誤用
効果量の定義同じ d = 0.5 でも、分母の取り方で意味が変わる
事前登録の有無Registered Report では肯定的所見が96%から44%に下がる
再現されているか頑健に再現されたのは25件中7件(28%)

いま言えること

  • 第1四分位誌に掲載された研究の再現プロジェクトでは、25件中7件(28%)のみが3基準すべてを満たして再現された
  • 再現時には、公表された効果量の大きさに実質的な低下があった
  • 90メタ分析・1,191研究から推定された検出力の中央値は、30%という低さでありうる
  • 検出力が低いことは「効果を見逃す」だけでなく「真の効果を誤解釈する」ことにつながる
  • 特定誌の実測では、平均観測検出力が53%(有意なもののみで61%)、標本サイズの中央値19
  • この問題は1972年から報告され、1977年・2000年・2020年の研究におおむね追認されている
  • p値からの脱却を目指した MBI は、推進側が「最適」とする標本サイズで第一種の過誤率を標準的検定の2〜6倍に膨張させた
  • MBI を用いた232論文の中央値は1群10名、事前の標本サイズ計算の報告は15%、1論文あたりの検定数の中央値は30、主要アウトカムの事前特定は14%
  • 「p値から研究者を遠ざけることが、二分法的な判断や過剰解釈を減らすという証拠は見出されなかった」
  • ただし MBI をめぐる論争は決着していない。推進側は50万回のシミュレーションに基づき「信頼できる代替手法」と主張している
  • 最も引用されたS&C分野のメタ分析20件のうち85%に統計的誤りがあり、45%が標準偏差と標準誤差を取り違えていた。その結果、効果量11や14という値が生じた事例がある
  • HIIT 文献では、小規模研究の p > 0.05 を「同等」の主張に用いる誤用が指摘されている
  • Registered Report では、肯定的所見の割合が96%から44%に下がる

この記事は、これまでの19本の記事に対する注釈でもあります。

ここまで扱ってきた領域——トレーニング反応の個人差、暑熱順化、運動と免疫、オーバートレーニング、早期専門化、練習スケジュール、注意の焦点、運動と骨密度、身体活動と認知、メンタルトレーニング、ランニングフォーム、用量反応、社会階層格差、学校体育、サプリメント汚染、アダプテッド身体活動、ウェアラブル精度、ACWR、最小可検変化量——のどれもが、この記事で述べた条件の下で生産された知見です。

だからこそ、繰り返し同じ形の留保が現れました。「効果はあるが確実性は低い」「感度分析で消えた」「出版バイアス補正で小さくなった」「信頼区間がゼロに接している」「研究数が少ない」。これらは個々の研究の欠点ではなく、分野全体の構造から生じています。

とはいえ、これは「スポーツ科学は信用できない」という結論ではありません。むしろ、これらの問題を実測し、公表し、改革を提案しているのは、この分野の研究者自身です。再現プロジェクトを実施し、最も引用されたメタ分析の誤りを数え、自誌の検出力を計算し、自分たちが推した統計手法を撤回した。それは健全な自己点検の証拠でもあります。

読む側にできるのは、「何が示されたか」と同じ熱心さで「どれだけ確からしいか」を見ることです。効果量の数字だけを取り出して使うのではなく、標本サイズ、信頼区間、確実性の評価、そして再現の有無まで含めて読む。それが、この分野の知見を実務に持ち込むときの最低限の作法になります。

出典

  1. Murphy J, et al. Estimating the Replicability of Sports and Exercise Science Research. Sports Medicine. 2025. DOI: 10.1007/s40279-025-02201-w
  2. Uehata A, et al. Statistical power analysis in exercise science. Journal of Sports Sciences. 2025. DOI: 10.1080/02640414.2025.2571841
  3. Mesquida C, et al. Publication bias, statistical power and reporting practices in the Journal of Sports Sciences: potential barriers to replicability. Journal of Sports Sciences. 2023. DOI: 10.1080/02640414.2023.2269357
  4. Mesquida C, et al. Replication concerns in sports and exercise science: a narrative review of selected methodological issues in the field. Royal Society Open Science. 2022;9:220946. DOI: 10.1098/rsos.220946
  5. Abt G, et al. Registered Reports in the Journal of Sports Sciences. Journal of Sports Sciences. 2021. DOI: 10.1080/02640414.2021.1950974
  6. Abt G, et al. Power, precision, and sample size estimation in sport and exercise science research. Journal of Sports Sciences. 2020. DOI: 10.1080/02640414.2020.1776002
  7. Buchheit M. The Numbers Will Love You Back in Return—I Promise. International Journal of Sports Physiology and Performance. 2016. DOI: 10.1123/ijspp.2016-0214
  8. Sainani KL. The Problem with “Magnitude-based Inference”. Medicine & Science in Sports & Exercise. 2018. DOI: 10.1249/MSS.0000000000001645
  9. Nevill A, et al. Can we trust “Magnitude-based inference”? Journal of Sports Sciences. 2018. DOI: 10.1080/02640414.2018.1516004
  10. Lohse KR, et al. Systematic review of the use of “magnitude-based inference” in sports science and medicine. PLoS ONE. 2020;15(6):e0235318. DOI: 10.1371/journal.pone.0235318
  11. Hopkins WG, Batterham AM. Error Rates, Decisive Outcomes and Publication Bias with Several Inferential Methods. Sports Medicine. 2016. DOI: 10.1007/s40279-016-0517-x
  12. Kadlec D, et al. With Great Power Comes Great Responsibility: Common Errors in Meta-Analyses and Meta-Regressions in Strength & Conditioning Research. Sports Medicine. 2022. DOI: 10.1007/s40279-022-01766-0
  13. Ekkekakis P, et al. Extraordinary Claims in the Literature on High-Intensity Interval Training (HIIT): I. Bonafide Scientific Revolution or a Looming Crisis of Replication and Credibility? Sports Medicine. 2023. DOI: 10.1007/s40279-023-01880-7
  14. Knudson D. Confirming Increased Statistical Errors in Testing Correlations from Small Sample Sizes. Measurement in Physical Education and Exercise Science. 2024. DOI: 10.1080/1091367X.2024.2439295
  15. Knudson D. Confidence crisis of results in biomechanics research. Sports Biomechanics. 2017. DOI: 10.1080/14763141.2016.1246603
  16. Schweizer G, Furley P. Reproducible research in sport and exercise psychology: The role of sample sizes. Psychology of Sport and Exercise. 2016. DOI: 10.1016/j.psychsport.2015.11.005
  17. Caldwell AR, Vigotsky AD. A case against default effect sizes in sport and exercise science. PeerJ. 2020;8:e10314. DOI: 10.7717/peerj.10314
  18. Hopkins WG, et al. Progressive statistics for studies in sports medicine and exercise science. Medicine and Science in Sports and Exercise. 2009;41(1):3–13. DOI: 10.1249/MSS.0b013e31818cb278
  19. Tomczak M, Tomczak E. The need to report effect size estimates revisited. An overview of some recommended measures of effect size. Trends in Sport Sciences. 2014;1(21):19–25.

この記事は公表された研究の要約であり、診断や治療の助言ではありません。統計的手法をめぐる論争のうち、決着していないものについては、その旨を本文中に明記しています。

💬 ご質問がある場合はこちらからどうぞ

オンザショアのチャットで質問する(24時間受付)

レッスン内容・料金・体験のご予約など、気になることをお気軽にお尋ねください。

ご体験予約