英語アプリの発音スコアは当てになる?|研究でわかる機械の得意と苦手

アプリの発音スコアが全然上がらなくて、正直へこみます。

気持ちはわかります。ただ、あの点数がそもそも何を測る道具として作られたのかを知ると、見え方がかなり変わりますよ。

えっ、実力を測っているんじゃないんですか?

多くの人がそう思っています。ただ研究の世界では、自動採点の良し悪しは昔から別の基準で確かめられてきたんですよ。

じゃあ僕の低い点は、何を意味してるんでしょう…

そこが今日の本題です。研究を並べていくと、機械が得意なことと苦手なことが、きれいに二つへ分かれて見えてきます。

僕はこの先、何を見て練習すればいいですか?

この記事では研究を順番にたどっていきます。最後には、点数とどう付き合えばよいかまで具体的に整理できるはずですよ。
結論: 発音アプリの点数は、あなたの実力そのものを映した数字ではない。
自動採点はもともと、人の採点者ならどう評価するかを機械が予測する道具として作られてきた。
つまり点数は「正解」ではなく「人の判断の真似」であり、真似が上手くいく部分といかない部分がある。
実際、大きな英語試験の自由発話では、機械と人の一致は人どうしの一致より一段はなれていた。
さらに機械の聞き取りやすさは話し手によって変わりうることも実測されている。
それでも「どの音を直せばいいか」を指す形のフィードバックには、改善につながった報告がある。
だから見るべきは点数の高さではなく、同じ課題を繰り返したときの自分の中の上下である。
この記事でわかること
- 機械が発音の「何」を測っているのか。意味ではなく音の形を照合しているという仕組み
- 機械の点と人の点はどれくらい合うのか。読み上げと自由発話で何が変わるのか
- 話す速さや間は測りやすく、答えの中身ややりとりの自然さは測りにくいという線引き
- 低い点が出たときに自分を責める前に確認すべきこと、そして点数の使い方の切り替え方
何度言い直しても点が上がらないのは、自分のせいなのか
同じ文を丁寧に言い直しても、アプリの発音判定が動かないことがある。逆に、急いで雑に言った回のほうが高い点が出ることもある。聞いてもらえる相手が身近にいないと、この点数だけが手がかりになる。だから点が伸びないと「自分には発音の才能がない」という結論に飛びやすい。
ここで立てるべき問いは、「自分の発音が悪いのか、それとも機械が聞き取れていないだけなのか」である。この問いには、実は答えの材料がある。機械の採点そのものを検証した研究が、20 年以上前から積み上がっているからだ。
その研究群がそろって示しているのは、次の一点である。自動採点の性能は、はじめから「人の採点者とどれだけ一致するか」で測られてきた。たとえば 2000 年に出た 2 本の論文は、どちらも先に人の評定を集め、そのうえで機械の点をそれと突き合わせている。つまり機械の点は、独立した正解ではない。人の判断を機械が予測しにいった結果の数字である。予測なのだから、当たる場面と外れる場面がある。
ここまでのまとめ: 発音スコアは実力の判定ではなく、人の採点者の判断を機械が予測した近似値である。だから低い点は、まず「機械が外した可能性」も含めて読む必要がある。
機械は意味ではなく「音の形」を照らし合わせている

音素って言われても、正直ピンと来なくて。

言葉をつくる一番小さい音のかけらです。2000 年の研究は、その一粒ずつをお手本の型紙と重ねて点にしていました。
自動採点の基本の考え方を作ったのが、Witt と Young の研究 (2000) である。この研究は、音素 (= 言葉を作るいちばん小さい音のかたまり) ごとに発音の良さを数値にする方法を検証した。
用いたのは「発音の良さの点数」と呼べる指標である。これは平たく言えば、お手本の音の型紙に自分の声がどれくらい重なるかを測って点にしたものだ。つまり機械が見ているのは、話し手が何を伝えたいかではない。声の形がお手本のパターンにどれだけ近いか、それだけである。
この研究は、音素ごとに合格ラインを個別に持たせる形へ指標を広げている。ラインは、母語話者 (= その言葉を子どものころから使ってきた人) の平均的なスコアと、人が「これは違う」と判定した統計の両方から決めた。
評価のやり方にも特徴がある。発音の評価はとても主観的だから、機械の点が人の点とどれだけ一致するかを測る物差しを 4 つ設計している。ここでも基準は人である。結論も「実用に足る性能を達成しうる」という慎重な言い方に留まる。
ここまでのまとめ: 機械は音の形をお手本と照合しているだけで、意味を聞いてはいない。しかもその出来映えは、人の判定とどれだけ合うかで確かめられてきた。
機械の点は「先生ならこう付けるだろう」の予想である
Neumeyer たちの研究 (2000) は、この設計思想をさらにはっきり述べている。発音の自動評価を、「人の専門家がその技能に対して与えるであろう評点を予測する問題」として扱っているのだ。
言い換えると、機械の点数は天気予報に近い。予報が良かったかどうかは、実際の空と比べて初めて分かる。発音採点も同じで、機械の点の良し悪しは、人の評価者が付けた点と突き合わせて初めて決まる。
この研究はまず、人の専門家による評定のデータベースを作り、そのうえで機械のスコアを開発した。検証に使われたのは、フランス語を話すアメリカ人の発音のデータである。英語学習者の音声ではないという限界は、そのまま残る。
結果として、一部の機械スコアは、十分な量の音声があれば人どうしの一致に匹敵する水準に達したと報告されている。ここでの「一部」とは、お手本の音への近さと、音を伸ばす長さをそろえて測った指標である。「十分な量」も、ひと言だけ吹き込んだ場合ではなく、いくつもの文を読み上げて材料をためた場合を指す。ただし「人と同じくらい合う」が上限であって、機械が人を超えたという話ではない。
ここまでのまとめ: 自動採点は人の評点を当てにいく予想であり、うまくいった場合の到達点は「人どうしと同じくらい」である。それより上の権威を点数に与える理由はない。
自由に話し始めたとたん、採点はむずかしくなる

読み上げと自由に話すのって、そんなに違うんですか?

別物です。大きな英語試験を扱った研究では、自由な発話だと機械と人の一致が、人どうしの一致より一段低く出ていました。
決まった文を読み上げるのと、自分の言葉で話すのとでは、機械の仕事の重さがまるで違う。ここを実際の大規模試験で検証したのが、Zechner たちの研究 (2009) である。
対象は、大きな英語試験の練習テストで話された非母語話者の自由な発話である。仕組みは、非母語話者 (= あとから英語を学んだ人) の英語で学習させた音声認識でできている。そこに、主に流暢さ (= どれくらいすらすら話せているか) に関わる特徴を計算する部分と、そこから得点を予測する部分が乗る。
数字はこうだ。6 問ひとそろいで、機械の点と人の点の一致の度合いは 0.57 だった。同じ場面で人どうしの一致は 0.74 で、0.17 の開きがある。この数字は 0 が「まったく別物」、1 が「ぴったり同じ」を表す目盛りだと考えればよい。近いけれど、一段はなれている、という距離感である。
一方で、1 問だけを見て機械と人の評価がぴたりと同じになった割合は 57.8% だった。人どうしの 57.2% とほぼ同水準である。見る角度で印象が変わるので、片方だけを取り出すのは公平ではない。
著者たち自身の位置づけもはっきりしている。結果の重みが小さい練習の場での運用なら正当化できる水準だ、と書いている。語彙・文法・内容に関わる特徴は後から足す計画だとも述べている。つまり初期の自動採点が拾えていたのは、話し方の形のほうだった。
なお、この種の採点は 2006 年から試験の練習用として運用されてきた。提供者の説明では、人の評定者より速く一貫した結果が得られるとされる。ただしそれは製品の説明であり、外から独立に検証した結果ではない。
ここまでのまとめ: 自由に話す場面の自動採点は、実際に運用されるところまで来ている。ただし人どうしの一致には届いておらず、開発側自身が「練習用なら」と限定していた。
測りやすいもの、測りにくいもの
では機械は何が得意なのか。Cucchiarini たちの研究 (2000) が、その輪郭をはっきりさせている。この研究は、話す速さやポーズの取り方といった時間に関わる指標を機械で計算し、人が感じる流暢さを予測できるかを調べた。
対象はオランダ語の母語話者 20 名と非母語話者 60 名の朗読で、9 名の専門家が流暢さを評定している。専門家どうしの判定はよくそろっていた (採点者の意見のそろい具合を表す目安で 0.90 から 0.96)。そして 6 つの自動指標と流暢さの評定の一致の度合いは 0.81 から 0.93 に収まった。もっともよく当たったのは発話の速さで、0.90 から 0.93 である。
ストップウォッチで測れるものは、機械が強い。速さ・間の長さ・言いよどみの回数は、どれも「形」だから数えられる。裏を返せば、数えられないものは苦手だということだ。
その苦手側を整理したのが、Litman たちのまとめ (2018) である。音声技術をスピーキング評価に使う話を概観した論文で、採点を目的にした利用が始まったのは比較的最近だと明記している。そして、スピーキングという力を何だと定義するかで、この技術で足りるかどうかの判断が変わると論じている。
ここで出てくるのが妥当性 (= 測りたいものを本当に測れているか) という考え方である。体重計にいくら正確に乗っても身長は分からない。同じように、速さと音の正確さをどれだけ精密に測っても、答えが的を射ているかは出てこない。このずれが、点数への違和感の正体であることは多い。
たとえば声の上げ下げも、機械にとっては単なる音の高さの変化だが、人にとっては意味を運ぶ道具である。この点は英語が棒読みになるのはなぜか、抑揚が意味を運ぶ仕組みで扱ったとおりで、数値化しやすさと大切さは別の話になる。
ここまでのまとめ: 速さ・間・音の正確さは測りやすく、内容の的確さややりとりの自然さは測りにくい。点数が拾えているのは、話す力の一部分である。
同じ機械でも、話し手が変わると聞き取りやすさが変わる

そもそも機械、ちゃんと聞き取れてるんですかね?

そこは疑ってよいです。ある研究では、聞き間違えた単語の割合が話し手の集団によって倍近く違うと実測されていました。
採点の前に、そもそも機械が正しく聞き取れているかという問題がある。ここを大規模に実測したのが、Koenecke たちの研究 (2020) である。
この研究は、大手 5 社の音声認識に、同じ形式のインタビュー音声を書き起こさせた。対象は米国の 5 都市で集めた合計 19.8 時間の音声で、話者は白人 42 名と黒人 73 名である。
結果は 5 つのシステムすべてで大きな差が出た。単語誤り率 (= 機械が聞き取った文のうち間違えた単語の割合) は、黒人話者で平均 0.35、白人話者で 0.19 だった。0.35 は、10 語のうち 3〜4 語を聞き間違えるということだ。同じ語句を話した部分だけを取り出しても差は変わらず、原因は機械が音を捉える仕組みの側にあるとされた。
ここで射程を間違えないことが大切だ。この研究が比べたのは米国英語を話す集団どうしであり、日本語を母語とする学習者の誤り率を測ったものではない。
言えるのはもっと一般的なことだ。同じ機械でも、話し手が変われば聞き取りやすさが変わりうる。この前提が成り立つ以上、1 回の低い点をそのまま自分への評価として受け取る根拠は弱い。まず「いまの録音を機械は聞き取れていたか」を疑ってよい。
ここまでのまとめ: 機械の聞き取りには話し手による当たり外れがある。低い点が出たら、実力の判定と決めつける前にその可能性を先に置く。
それでも、自動フィードバックが効く形はある

結局、発音アプリを使う意味はあるんですか?

あります。ただし効いたのは点数ではなく、どの音がずれたかを名指しする形だったと、2008 年の研究が示しています。
ここまで限界の話が続いたが、結論は「機械の採点は無意味」ではない。効く形がはっきりしている、というのが研究から見える姿だ。効いたのは点数を返すだけの画面ではなく、「いまの音はここがずれている」と場所を名指しする画面のほうだった。
Neri たちの研究 (2008) は、音声認識を使って発音のどこを直せばよいかを指すシステムを作り、実際に学習者が良くなるかを検証した。この研究の対象言語は英語ではなくオランダ語である。だから英語学習にそのまま当てはめることはできない。
参加者 30 名を 3 つの群に分けた。機械の指摘つきで練習した群、指摘なしの群、練習しなかった群である。発音全体の質では、指摘つきの群の平均改善がもっとも大きかったが、群の差は統計的に有意ではなかった。有意とは、偶然のばらつきでは説明しにくい差だという判定である。
一方で、訓練で狙った難しい音については、指摘つきの群が指摘なしの群より明確に大きく改善した。つまり「点数を返す」ことではなく、「この音を直せ」と名指ししたことが効いた。この論文は、誤った指摘が学習をこじらせうることも自ら明記している。
この方向は他の研究でも支持されている。コンピュータを使った発音訓練のメタ分析 (= 世界中の研究を集めて全体の傾向を出す方法) は、20 件・合計 1014 名から正の効果を報告した。効果の大きさは d = 0.68 で、クラスの平均点が一段階上がるくらいの効き目にあたる。ただし著者自身が、元の研究は数が少なく質も低いため証拠は決定的でないと注意している。
学習テクノロジー全般を 350 本以上の研究から見渡したレビューも、似た地図を描いている。テクノロジーが学習に効いたという強い支持は限られるが、その数少ない領域の 1 つが発音訓練、とくに音声認識を使った研究だったとしている。チャットでのやりとりも、支持が強い側に挙がっている。
人に直してもらう場合も、効くのは「直され方」のほうだった。この点は英語の間違いは直してもらったほうが伸びるのかでも扱っている。機械でも人でも、直す場所が具体的に分かる形が要になる。
ここまでのまとめ: 効いたのは点数ではなく、どの音をどう直すかの名指しだった。点しか返さないアプリと、直す場所を指すアプリは別物として扱ってよい。
点数そのものを見るのをやめる、という使い方
以上を踏まえると、使い方の切り替え方が決まる。点数の絶対値を実力の判定として受け取るのをやめ、同じ条件で繰り返したときの自分の中の上下だけを見ればよい。たとえば毎朝、同じ部屋で同じ一文を読み上げ、その点の並びだけを眺めるという形になる。
手順は難しくない。第一に、録音の条件を毎回そろえる。機械の聞き取りやすさは話し手によって変わりうる。だから聞き取り側の揺れを減らす意味で、同じ部屋、同じ距離、同じ端末にする。第二に、課題を使い回す。毎回違う文で測ると、文の難しさの差が点数に混ざる。第三に、1 回の点で判断せず、数回の平均を見る。第四に、点数より「どの音を指されたか」を記録する。
限界もはっきりしている。ここで紹介した研究の多くは、実験室に近い条件や特定の言語・集団を対象にしている。提供者の説明ページにも、限界の記載は見当たらない。市販アプリが内部で何を計算しているかもほとんど公開されておらず、研究の結果がそのまま当てはまる保証はない。
そもそも数字で自分の到達点を測ろうとすると行き詰まりやすい。自分の英語レベルがわからないときに、点数ではなく「できること」で測る方法で整理したとおり、できるようになった行動を並べるほうが実態に近い。発音も同じで、「この音を意識できた」のほうが点より確かな記録になる。
ここまでのまとめ: 点の高さではなく、条件をそろえた繰り返しの中の変化を見る。指摘された音を記録することが、点数を眺めるより実利がある。
手元の AI 練習ツールに、研究が示した条件を当てはめられるか

AI 英会話って、先生の代わりになりますか?

そこは正直まだ研究が足りません。今は代わりではなく、同じ条件で繰り返す記録係として使うほうが研究と噛み合います。
自動採点は、AI 英会話アプリがその場で返してくる評価の中身そのものである。だからここまでの研究は、日々の練習の設計にそのまま接続できる。ただし問いの形を変える必要がある。「AI を使えば上達するか」ではなく、「研究が効くと示した条件を、手元のツールで満たせるか」である。
満たすべき条件は 3 つに整理できる。同じ課題を何度でも繰り返せること、どの音を直すかを名指ししてくれること、録音の条件をそろえられることだ。人に頼む場合と違い、機械なら同じ課題を同じ条件で何度でも再現できる。これは繰り返しやすさの話であって、上達の速さを人と比べたものではない。
では、機械と話す練習そのものの効果はどうか。機械と外国語で会話する仕組みを 343 本の文献から洗い出したレビューは、関連システム 96 件を 4 つの型に分類した。「AI 英会話」とひとくくりにすると中身の差が見えなくなる。効果をまとめたメタ分析では、習熟度の発達に中くらいの効き目 (d = 0.58) が報告されている。スピーキングに絞った別のメタ分析でも中くらい (g = .61) だった。魔法のような大きさではないが、無視してよい小ささでもない。
ここで混ぜてはいけない線がある。これらは「機械と話す練習の効果」を調べたもので、「機械の採点が正確か」を調べたものではない。前者を後者の根拠にはできない。さらに、生成 AI による発音やスピーキングの自動採点が人の採点者とどれだけ一致するかを検証した研究は、2026 年 9 月時点でまだ乏しい。スピーキングのメタ分析自身が、生成 AI との統合を今後の課題として挙げる段階である。いまの時点では、AI の採点は人の評価の代わりではなく、条件をそろえた繰り返しの記録係として使うのが研究と整合する。
ここまでのまとめ: AI ツールは「繰り返し・名指し・同条件」という条件を揃えやすい。ただし採点の正確さについては、まだ研究が足りていない領域である。
よくある質問
Q. 正しく発音したはずなのに低い点が出ます。機械が間違っているのですか。
A. どちらの可能性もある、というのが正直な答えである。機械の聞き取りやすさは話し手によって変わりうることが実測されている。まずは録音の条件を整えて、同じ課題をもう一度試すのがよい。それでも同じ音で下がり続けるなら、その音は実際に弱点である可能性が高い。
Q. 読み上げの採点と、自由に話す採点は同じものですか。
A. 違う。自由に話す場面では聞き取り自体が難しくなり、採点の土台が揺らぐ。大規模試験の自由発話を扱った研究では、機械と人の一致は 0.57 で、人どうしの 0.74 より一段低かった。読み上げの点をそのまま会話の力と読み替えないほうがよい。
Q. 点数が同じでも、内容が良いかどうかは測られていないのですか。
A. 初期の自動採点が主に拾っていたのは、話し方の形のほうである。速さ・間・音の正確さは測りやすい一方、答えの中身ややりとりの自然さは数値化しにくい。点が良くても内容の的確さが保証されるわけではない。
Q. 発音アプリを使う意味はありますか。
A. ある。ただし効いたのは点数ではなく、どの音を直せばよいかを名指しする形のフィードバックだった。発音訓練をまとめたメタ分析でも正の効果が報告されているが、著者自身が証拠は決定的でないと注意を添えている。
Q. 機械の採点があれば、人に聞いてもらう必要はなくなりますか。
A. そうは言えない。自動採点はもともと人の採点者の判断を予測する道具として設計されてきた。人の指導を置き換えられると示した研究は、ここで扱った範囲には見当たらない。役割が違う道具として並べて使うのが妥当である。
まとめ
発音アプリの点数は、自分の実力を直接映した数字ではない。人の採点者ならどう評価するかを、機械が予測した近似値である。予測である以上、当たる場面と外れる場面がある。
測りやすいのは、速さ・間・音の正確さといった話し方の形だった。測りにくいのは、答えの中身ややりとりの自然さである。しかも機械の聞き取りやすさは話し手によって変わりうる。自由発話の自動採点では、機械と人の一致が人どうしの一致に届いていない。
それでも、直す場所を名指しするフィードバックには改善の報告がある。捨てるべきは点数への信仰であって、道具そのものではない。条件をそろえて同じ課題を繰り返し、自分の中の変化と指摘された音だけを記録する。機械の採点は無意味でもなければ、先生の代わりでもない。この二面性を保つことが、いちばん現実的な使い方になる。
参考文献
- Witt, S. M., & Young, S. J. (2000). Phone-level pronunciation scoring and assessment for interactive language learning. Speech Communication, 30(2-3), 95-108. https://doi.org/10.1016/S0167-6393%2899%2900044-8
- Neumeyer, L., Franco, H., Digalakis, V., & Weintraub, M. (2000). Automatic scoring of pronunciation quality. Speech Communication, 30(2-3), 83-93. https://doi.org/10.1016/S0167-6393%2899%2900046-1
- Cucchiarini, C., Strik, H., & Boves, L. (2000). Quantitative assessment of second language learners’ fluency by means of automatic speech recognition technology. The Journal of the Acoustical Society of America, 107(2), 989-999. https://doi.org/10.1121/1.428279
- Neri, A., Cucchiarini, C., & Strik, H. (2008). The effectiveness of computer-based speech corrective feedback for improving segmental quality in L2 Dutch. ReCALL, 20(2), 225-243. https://doi.org/10.1017/S0958344008000724
- Zechner, K., Higgins, D., Xi, X., & Williamson, D. M. (2009). Automatic scoring of non-native spontaneous speech in tests of spoken English. Speech Communication, 51(10), 883-895. https://doi.org/10.1016/j.specom.2009.04.009
- Golonka, E. M., Bowles, A. R., Frank, V. M., Richardson, D. L., & Freynik, S. (2014). Technologies for foreign language learning: a review of technology types and their effectiveness. Computer Assisted Language Learning, 27(1), 70-105. https://doi.org/10.1080/09588221.2012.700315
- Litman, D., Strik, H., & Lim, G. S. (2018). Speech Technologies and the Assessment of Second Language Speaking: Approaches, Challenges, and Opportunities. Language Assessment Quarterly, 15(3), 294-309. https://doi.org/10.1080/15434303.2018.1472265
- Mahdi, H. S., & Al Khateeb, A. A. (2019). The effectiveness of computer-assisted pronunciation training: A meta-analysis. Review of Education, 7(3), 733-753. https://doi.org/10.1002/rev3.3165
- Bibauw, S., François, T., & Desmet, P. (2019). Discussing with a computer to practice a foreign language: research synthesis and conceptual framework of dialogue-based CALL. Computer Assisted Language Learning, 32(8), 827-877. https://doi.org/10.1080/09588221.2018.1535508
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., & Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684-7689. https://doi.org/10.1073/pnas.1915768117
- Bibauw, S., Van den Noortgate, W., François, T., & Desmet, P. (2022). Dialogue systems for language learning: A meta-analysis. Language Learning & Technology, 26(1), 1-24. https://doi.org/10.64152/10125/73488
- Hou, Z., & Min, S. (2026). Dialogue-based computer-assisted language learning systems for second language speaking development: A three-level meta-analysis. ReCALL, 38(1), 40-56. https://doi.org/10.1017/S0958344025100268
- ETS. SpeechRater Service: Advanced Spoken-response Scoring Application. https://www.ets.org/speechrater.html
最終更新日: 2026-09-26
著者: 中村 拓(Taku Nakamura)(greencafe 編集部 編集責任者・非ネイティブ話者)。公開された 13 件の研究エビデンス(tier 1=12 件 / tier 2=1 件)を横断分析・再構成した。
画像: いらすとや (https://www.irasutoya.com/) より
この記事を編集した人
公開日: / 最終更新:

