英語は口元で聞き取れる?|研究でわかった目で聞くしくみと日本人のクセ

オンライン英会話で先生の映像が止まると、急に聞き取れなくなるんです。

気持ちはわかります。多くの人が同じ体験をしています。実は、聞き取りは耳だけで決まるとは限らない、という研究の流れがあるんですよ。

やっぱり僕の耳が悪いんでしょうか。努力が足りないのかな…

そう思い込む人は多いです。でも音声の研究では、人が何を手がかりに音を聞いているかが長く調べられてきました。耳の良し悪しだけの話ではないんです。

研究で分かると言われても、僕にも使える話なんですか?

大丈夫です。研究は、どんな音にどんな練習が効きやすいかを、条件ごとに整理しています。根性の問題ではなく、練習の組み立て方の問題として考えられますよ。

なるほど…。具体的には、何から知ればいいんですか?

この記事では、13 本の研究を順番に見ていきます。まずは、人がどうやって音を聞き取っているのか、そのしくみから一緒に確かめていきましょう。
結論: 人は音を耳だけで聞いているわけではない。
騒がしい場所では、話す人の顔が見えるだけで聞き取りが助けられることが、古い実験で示されている。
口の動きと音がずれると、別の音に聞こえてしまう現象も報告されている。
一方で、日本語で育った人は、聞き取りやすい条件では口元にあまり頼らない傾向がある。
口元つきの練習が日本人学習者に効きやすいのは、B と V のように外から見える音である。
L と R では研究の結果が分かれている。
つまり口元は万能の近道ではないが、音の種類を選べば使える手がかりになる。
この記事でわかること
- カメラが切れたりマスク越しだったりすると聞き取りにくくなる理由を、研究から考えた説明
- 日本語で育った人が口元にあまり頼らない、という研究の中身とその条件
- 口元つきの練習で伸びやすい音と、伸びにくい音の線引き
- 顔が見える動画と鏡の練習を、音の種類で使い分ける手順
カメラが切れた瞬間に聞き取れなくなるのは、耳が悪いからではない
オンライン英会話の途中で、先生の映像が止まる。声は届いているのに、急に話が追えなくなる。会議で相手がマスクをしていると、同じ英語がさらに遠く感じる。
多くの人は「自分の耳が悪い」と考える。だが立てるべき問いは、「さっきまで耳以外の何かも使って聞いていたのでは」というものだ。
音声の研究では、この問いに長い歴史がある。話す人の顔が見えるかどうかで聞き取りが変わるかは、70 年以上前から実験で調べられてきた。さらに、目からの情報が聞こえ方そのものを作り変える例も報告されている。
ここまでのまとめ: 映像が切れると聞き取れなくなる体験は、耳の弱さだけでは説明しきれない。耳以外の手がかりを使っていた可能性を、研究で確かめていく。
人は耳だけでなく目でも音を聞いている

視聴覚統合って言われても、正直ピンと来ないんですけど…

映像と音声が合わさって 1 つのテレビ番組になる、というイメージです。1954 年の実験では、顔が見える助けは騒がしい場面ほど生きると示されています。
最初の研究は、1954 年に Sumby と Pollack が行った実験である。2 人は、言わば「声の聞こえ方を測る専門家」である。
実験では、話す人の顔と唇の動きを見ながら聞く条件と、見ないで聞く条件を比べた。にぎやかな教室で友だちの声が聞こえにくいとき、顔を見ると分かりやすくなる。あの感覚を、測れる形にした実験と言える。
結果の読み方には少し注意が要る。目の助けは、「助けられる余地」に対する割合で見ると、騒音の大きさにあまり左右されなかった。ただし著者は、これを「大まかに見れば」という控えめな言い方でまとめている。
一方で、騒音が大きいほど、そもそも聞き取れずに困る部分が増える。だから目の助けが一番生きるのは騒がしい場面だ、と著者は結論している。テストの点が低い人ほど伸びしろが大きい、という話に少し似ている。
このように、目と耳の情報を頭の中で 1 つにまとめる働きを、視聴覚統合と呼ぶ。テレビの映像と音声が合わさって 1 つの番組になるように、脳も 2 つの入力を合わせて「聞こえ」を作っている、というイメージだ。
ここまでのまとめ: 話す人の顔が見えると、聞き取りは助けられる。その助けが特に生きるのは、騒がしくて耳だけでは苦しい場面である。
口の動きが「聞こえ方」そのものを変える

えっ、目のせいで違う音に聞こえるなんてあるんですか?

あるんです。腹話術の人形から声が出るように感じるのと同じです。口が「ガ」で音が「バ」だと、「ダ」と聞こえたと大人が答えた報告があります。
目の情報は、聞き取りの「おまけ」なのだろうか。この問いに強い答えを出したのが、1976 年に科学誌 Nature に載った McGurk と MacDonald の報告である。2 人は、言わば「人がどう音を感じ取るかを調べる研究者」である。
実験では、女性が話す顔の映像に、別の音を重ねた。口は「ガ」と動いているのに、音は「バ」を流す。すると普通の大人は「ダ」と聞こえたと答えた。
この現象はマガーク効果と呼ばれる。目と耳の情報がぶつかると、どちらでもない音が聞こえる錯覚だ。腹話術の人形から声が出ているように感じるのと同じく、目が耳をだますのである。
逆に、口が「バ」で音が「ガ」のときは、「バガ」や「ガバ」のように聞こえた人が多かった。そして同じ音を映像なしで聞くと、きちんと「バ」や「ガ」と答えられた。
著者はここから、純粋に耳の働きだと思われていた音の聞き取りに、目が影響していると結論している。つまり口元の情報は、聞こえ方を後から補うだけでなく、聞こえ方そのものを決める材料に入り込んでいる。
ここまでのまとめ: 口の動きと音がずれると、別の音に聞こえてしまう。目からの情報は、聞こえ方を作る材料の一部として働いている。
日本語で育った人は、口元にあまり頼らない聞き方をしている

日本人って、生まれつき口元を見るのが苦手なんですか?

そう言い切れる研究はありません。6 歳では日本語の子も英語の子も同じくらいで、育つ途中で英語の子だけ口元に頼る度合いが強まったと報告されています。
では、日本語で育った人にも、マガーク効果は同じように起きるのだろうか。
1991 年、Sekiyama と Tohkura がこれを調べた。2 人は、言わば「日本語の耳の働きを調べる専門家」である。日本語の 10 個の音節 (バ・パ・マ・ダ・ガなど) の音と映像を組み合わせ、日本語話者 10 人に聞かせた。
雑音のない条件では、マガーク効果は小さかった。起きたのは、音だけでも 100% は聞き取れない、もともと聞き取りにくい音にほぼ限られていた。
ところが雑音のある条件では、マガーク効果はとても強く、広い範囲で起きた。音がはっきり聞こえるときは口元をあまり見ないが、うるさくなると急に口元に頼り出す。日本語話者にはそんなクセがある、ということだ。
この研究の条件は、正しく押さえておく必要がある。調べたのは日本語話者が日本語の音節を聞く場面で、英語を聞く実験ではない。「日本人は口元を使えない」という話ではなく、「聞き取りやすい条件では口元の影響を受けにくい」という話である。
では、このクセは生まれつきなのか。この点を調べたのが、2008 年の Sekiyama と Burnham (言わば「子どもの聞き方の育ち方を調べる専門家」) の研究である。
まず大人で、日本語話者のほうが英語話者より目の影響が弱いという報告を、答えと反応の速さの両方で支持した。次に、6 歳・8 歳・11 歳の子どもを両方の言語で調べた。
6 歳の時点では、日本語の子も英語の子も目の影響は低く、同じくらいだった。英語の子は年齢とともに目の影響が強まり、特に 6 歳から 8 歳の間で大きく伸びた。日本語の子は変わらなかった。
ただし、この研究は「生まれつきではないと証明した」わけではない。言えるのは、6 歳では差がなく、育つ途中で英語の子だけ口元に頼る度合いが強まった、というところまでだ。その差が言葉の経験と関係している可能性がある、と考えるのが研究に沿った読み方である。
英語学習の場面でも似た傾向が出ている。英語の B と V の聞き分けでは、日本語話者の学習者はスペイン語話者の学習者より、口元の手がかりへの感度がずっと低かった。
だから自分を責める必要はない。英語で口元をうまく使えていないなら、それは怠けではなく、日本語で育つ中で身についた聞き方の違いかもしれない。
ここまでのまとめ: 日本語話者は、聞き取りやすい条件では口元にあまり頼らない。ただし雑音があれば強く頼る。この差は子どもが育つ途中で開いていく様子も報告されている。
カメラ切れやマスク越しがつらい理由を、研究から考える
最初の悩みに戻ろう。先に断っておくと、映像が切れたときやマスク越しの英語の聞き取りを、そのまま測った研究は無い。ここから先は、これまでの研究から言える範囲で考えた推測である。
まず、日本語話者でも雑音がある条件では口元に強く頼っていた。英語は学習者にとって、日本語より聞き取りにくい言葉だ。耳だけでは苦しい状態は、雑音がある状態と少し似ている。
次に、目の助けが最も生きるのは、耳だけで聞き取れない部分が大きい場面だった。学習中の英語は、まさにその状態にある。だから、本人が意識していなくても、口元の情報を手がかりにしていた可能性はある。
映像が切れた瞬間に聞き取りが落ちるのは、使っていた手がかりが 1 つ消えたからかもしれない。マスクで口元が隠れる場合も、同じ理屈が当てはまりうる。
特に影響が出やすいのは、唇や歯の形で見分ける音だと考えられる。後で見るように、口元の助けが確かめられているのは B と V のような音の組である。
もう 1 つ、別の原因もある。英語が聞き取れないのは「耳が悪い」からではなく、聞いた量が足りないことが大きいという研究の整理もある。口元の話は、聞き取りの原因の 1 つにすぎない。
ここまでのまとめ: 映像やマスクの場面を直接測った研究は見つかっていない。ただ、耳だけで苦しいときほど口元に頼るという研究から、手がかりが 1 つ消えた影響だと推測できる。
口元つきで練習すると、日本人の聞き分けは伸びたのか

知覚訓練って、具体的にどんな練習なんですか?

似た 2 つの音を聞いて「どっち?」と当てる、耳の筋トレです。日本人学習者の研究では、B と V は顔つき練習の伸びが大きく、L と R は結果が分かれました。
では、口元を見ながら練習すれば、英語の聞き分けは伸びるのか。ここでは知覚訓練の研究を見ていく。知覚訓練とは、似た 2 つの音を何度も聞いて「どっち?」と当てる練習のことで、耳のための筋トレのようなものだ。
まず、研究者 Hardison (言わば「外国語の発音の身につけ方を調べる専門家」) が 2003 年に発表した研究がある。日本語話者と韓国語話者の英語学習者に、R と L の聞き分けを 3 週間練習してもらった。
練習には、いろいろな人が自然に話すビデオを使った。音と映像で練習したグループは、音だけのグループより伸びが大きかった。その力は、練習に使っていない新しい単語や新しい話し手にも広がった。
発音にも有意な改善が見られた。「有意」とは、偶然ではなさそうだと統計で確かめられた、という意味である。
一方で、研究者 Hazan (言わば「音の聞き分け練習の専門家」) のチームは、少し違う結果を出している。日本人英語学習者 62 人に、L と R の聞き分けを 10 回練習してもらった。
練習は、音だけ・本物の人の顔つき・合成顔つきの 3 種類である。合成顔とは、アニメのキャラのようにコンピュータで作った話す顔のことだ。
結果、L と R の聞き分けは全部のグループで伸びた。ただし、顔つきで練習したグループが、音だけのグループより大きく伸びたわけではなかった。耳だけで聞く力は、むしろ音だけで練習したグループが一番伸びた。
その一方で、練習のあと L と R の発音も有意に良くなった。そして本物の顔つきで練習したグループは、発音の伸びがより大きかった。聞き分けと発音で、口元の効き方が違ったわけである。
同じチームは B と V でも練習を試した。日本語話者 39 人が、音だけか音と映像で 10 回の集中練習を受けた。両方とも伸び、音と映像のグループの伸びがより大きかった。
この効果は、練習の前に口元の手がかりにどれだけ敏感だったかには左右されなかった。つまり、最初は口元をうまく使えていなかった人でも、練習の効果は同じように出たということだ。
同じチームは、日本人英語学習者に音と顔の映像で練習してもらう研究を、学術誌にも発表している。
ここまでのまとめ: B と V では、口元つき練習の伸びが音だけより大きかった。L と R では、伸びが大きかった研究と、音だけと差が無かった研究があり、結果が分かれている。
口元が効く音と、効きにくい音の線引き

L と R も、口元を見ればなんとかなりませんか?

そう期待したくなりますよね。L と R は舌が口の奥で動くので外から見えにくく、2006 年の研究では顔を見せても上乗せは見られませんでした。
結果が分かれる理由は何だろうか。手がかりになるのが、2006 年に Hazan のチームが発表した研究である。
この研究では、音の組を 2 種類に分けて調べた。1 つ目は B と V のように、唇や歯の形で作る音の組である。B は唇を閉じて作り、V は上の歯で下唇に軽く触れて作る。外から見て違いが分かる音だ。
この組では、日本語話者もスペイン語話者も、音と映像の条件のほうが音だけより得点が高かった。目の助けが、どちらのグループにも出たのである。
2 つ目は L と R である。この 2 つは、舌が口の中でどう動くかで決まる部分が大きく、外からは見えにくい。窓の外から、部屋の中の出来事は見えない。それと似ている。
L と R のテストでは、日本語話者にも韓国語話者にも、音と映像による上乗せは見られなかった。著者は、母語 (= 生まれて最初に覚えた言葉。日本人なら日本語) と、音の違いが見た目でどれだけ分かるかが、口元の使い方に影響すると結論している。
耳での聞き分けが上手な人ほど、口元の手がかりも上手に使える、という関係も報告されている。目と耳は一緒に育つのかもしれない。L と R が難しい理由は、L と R が同じに聞こえるのは脳の「音の地図」が日本語向けに整うからという研究でも扱っている。
英語以外の言葉でも、口元が助けになった例がある。研究者 Navarra と Soto-Faraco (言わば「目と耳の合わさり方を調べる専門家」) の 2007 年の研究だ。
対象は、スペイン語とカタルーニャ語の両方を話すバイリンガル (= 2 つの言葉を日常的に使う人) である。カタルーニャ語はスペインの一部で話される言葉だ。「エ」に近い 2 種類の母音 (= ア・イ・ウ・エ・オのような音) の聞き分けを調べた。
音だけで聞くと、スペイン語が強い人はこの 2 つの違いに反応できなかった。ところが音と映像で見せると、区別できるようになった。耳だけでは同じに聞こえる 2 つの音も、口の形を一緒に見ると「違う音だ」と気づけたのである。
ただし、これは日本人の英語学習を調べた研究ではない。また、映像だけで音が無いと、どちらのグループもはっきりとは区別できなかった。口元は、音と合わさったときに力を出す、ということだ。
この点は、音を消した練習の研究とも合っている。日本人学習者が、音を消して顔だけを見る練習で L と R を 7 回訓練した研究がある。
練習の結果、映像だけ、または音と映像の条件での聞き分けは伸びた。しかし、耳だけで聞く条件には効果が移らなかった。そして、練習のあとに発音が良くなった証拠も見られなかった。
ここまでのまとめ: 口元が効きやすいのは、B と V のように外から見える音である。L と R のように口の奥で決まる音では、目の上乗せは限られる。口元は音と組み合わせて使うものだ。
音の種類に合わせて、練習を使い分ける

鏡で自分の口を見て練習すれば、発音も良くなりますよね?

気持ちはわかりますが、そうとは言えません。音を消して口元だけを見る練習の研究では、発音が良くなった証拠は見られなかったと報告されています。
ここまでを練習の手順に落とし込む。ただし、これは研究がそのまま試した手順ではなく、研究の線引きに沿って考えた工夫である。
1 つ目は、B と V のような外から見える音である。ここでは、話す人の顔がはっきり見える動画で聞く練習を加える価値がある。日本人学習者でも、音と映像の練習で伸びが大きかったからだ。
2 つ目は、L と R のように見えにくい音である。ここでは、耳での聞き分け練習を中心にする。顔つきで練習しても、テストで顔を見せても、上乗せが見られなかった研究があり、耳だけの力は音だけの練習で一番伸びていた。
ただし、L と R でも音と映像の練習で伸びが大きかった研究がある。顔つきの練習を無駄と言い切る必要はない。
3 つ目は、鏡やスマホのインカメラで自分の口元を見る練習である。ここは慎重さが要る。音を消して口元だけを見る練習では、発音が良くなった証拠は無かった。この研究は他人の顔を見る練習で、鏡で自分の口元を見る練習を直接測ったものではない。
だから「鏡で口元を見れば発音が良くなる」とは言えない。使うとしても、音を聞いて真似する練習の補助として、B と V のように形の違いがはっきりした音で使う程度が研究に沿っている。
もう 1 つ、聞き取りにくさの理由は口元だけではない。カタカナ英語が抜けないのは、日本語の耳が「ない母音」を聞き足してしまうからという研究もある。口元の練習は、耳の練習と並べて使うものだ。
ここまでのまとめ: 見える音には顔つきの動画を足し、見えにくい音は耳の練習を中心にする。鏡の練習は、発音を直す保証ではなく補助として使う。
AI が作る話す顔は「口元が見える条件」を満たせるのか
最近は、AI 英会話や AI のアバター (= 画面の中で話す、作られたキャラクターの顔) が身近になった。では、研究が示した「口元が見える条件」を、AI の顔で満たせるのだろうか。
近い研究はある。研究者 Massaro (言わば「話す顔をコンピュータで作って学習に使う専門家」) のチームは、コンピュータで作った話す顔 Baldi を先生役にした。Baldi は、ほっぺを透かして舌の動きまで見せてくれる、理科の模型のような顔だ。8 歳から 13 歳の聴覚障害のある子ども 7 人で、聞き取りと発音が改善したと報告されている。
ただし、条件の違いは大きい。対象は聴覚障害のある子どもで、英語を外国語として学ぶ人ではない。Baldi も今の生成 AI ではなく、2000 年代のコンピュータアニメーションの顔である。新しい言語の音を練習した続きの研究もあるが、結果は「予備的」、つまり下書き段階の報告にとどまる。
日本人の英語学習者で、AI の顔を使った練習の効果を確かめた研究は見当たらない。この点を AI で検証した研究はまだ少ない、というのが正直な現状である。
一方で、研究から立てられる問いはある。マガーク効果が示すように、口の動きと音がずれると別の音に聞こえうる。もし AI の顔の口の形やタイミングが不正確なら、聞こえ方を助けるどころか乱す可能性もある。AI の顔を使うなら、まず「口の動きは音と合っているか」を問う必要がある。
ここまでのまとめ: AI の話す顔で英語学習者の聞き取りが伸びるかは、まだ確かめられていない。口の動きと音がずれると聞こえ方が変わる、という研究から、合っているかを問うことが先になる。
よくある質問
Q1. 口元を見れば、英語は聞き取れるようになりますか?
助けにはなりうるが、万能ではない。効きやすいのは B と V のように外から見える音で、L と R では目の上乗せが見られなかった研究もある。
Q2. 日本人は口元を使えないので、意味がないのですか?
そうではない。日本語話者は聞き取りやすい条件では口元にあまり頼らないが、雑音がある条件では強く頼っていた。また、B と V の練習では、最初の口元への感度に関係なく効果が出ていた。
Q3. オンライン英会話で、カメラはオンにしてもらったほうがいいですか?
映像の有無を直接測った研究は見つかっていない。顔が見えると聞き取りが助けられる研究からは、オンのほうが手がかりは増えると推測できる。
Q4. 鏡を見て発音練習すれば、発音は良くなりますか?
そうとは言えない。音を消して口元を見るだけの練習では、発音が良くなった証拠は無かった。鏡は、音を真似する練習の補助として使うのが研究に沿っている。
Q5. L と R は、どう練習すればいいですか?
結果が分かれているので、耳での聞き分け練習を中心にするのが無難である。顔つきの動画は補助として足す程度でよい。
まとめ
映像が切れると英語が聞き取れなくなるのは、耳の弱さだけが原因とは限らない。人は耳だけでなく、話す人の口元からも音の手がかりを受け取っている。その手がかりは、騒がしくて耳だけでは苦しい場面ほど生きる。
日本語で育った人は、聞き取りやすい条件では口元にあまり頼らない。この差は子どもが育つ途中で開いていく可能性が報告されており、怠けの証拠ではない。
口元つきの練習は、B と V のように外から見える音で効きやすかった。L と R のように口の奥で決まる音では、結果が分かれている。口元は万能の近道ではないが、音の種類を選べば、耳の練習を支える手がかりになる。
参考文献
- Sumby, W. H., & Pollack, I. (1954). Visual contribution to speech intelligibility in noise. Journal of the Acoustical Society of America, 26(2), 212-215. https://doi.org/10.1121/1.1907309
- McGurk, H., & MacDonald, J. (1976). Hearing lips and seeing voices. Nature, 264(5588), 746-748. https://doi.org/10.1038/264746a0
- Sekiyama, K., & Tohkura, Y. (1991). McGurk effect in non-English listeners: Few visual effects for Japanese subjects hearing Japanese syllables of high auditory intelligibility. Journal of the Acoustical Society of America, 90(4), 1797-1805. https://doi.org/10.1121/1.401660
- Sekiyama, K., & Burnham, D. (2008). Impact of language on development of auditory-visual speech perception. Developmental Science, 11(2), 306-320. https://doi.org/10.1111/j.1467-7687.2008.00677.x
- Hazan, V., Sennema, A., Iba, M., & Faulkner, A. (2005). Effect of audiovisual perceptual training on the perception and production of consonants by Japanese learners of English. Speech Communication, 47(3), 360-378. https://doi.org/10.1016/j.specom.2005.04.007
- Hazan, V., Sennema, A., & Faulkner, A. (2004). Effect of intensive audiovisual perceptual training on the perception and production of the /l/-/r/ contrast for Japanese learners of English. In Proceedings of Interspeech 2004 (会議論文), 1145-1148. https://doi.org/10.21437/Interspeech.2004-414
- Iba, M., Sennema, A., Hazan, V., & Faulkner, A. (2004). Use of visual cues in the perception of a labial/labiodental contrast by Spanish-L1 and Japanese-L1 learners of English. In Proceedings of Interspeech 2004 (会議論文), 2497-2500. https://doi.org/10.21437/Interspeech.2004-426
- Hardison, D. M. (2003). Acquisition of second-language speech: Effects of visual cues, context, and talker variability. Applied Psycholinguistics, 24(4), 495-522. https://doi.org/10.1017/S0142716403000250
- Hazan, V., Sennema, A., Faulkner, A., Ortega-Llebaria, M., Iba, M., & Chung, H. (2006). The use of visual cues in the perception of non-native consonant contrasts. Journal of the Acoustical Society of America, 119(3), 1740-1751. https://doi.org/10.1121/1.2166611
- Navarra, J., & Soto-Faraco, S. (2007). Hearing lips in a second language: visual articulatory information enables the perception of second language sounds. Psychological Research, 71(1), 4-12. https://doi.org/10.1007/s00426-005-0031-5
- Hazan, V., & Sennema, A. (2007). The impact of visual training on the perception and production of a non-native phonetic contrast. In Proceedings of Auditory-Visual Speech Processing (AVSP 2007) (会議論文), paper L6-1. https://www.isca-archive.org/avsp_2007/hazan07_avsp.html
- Massaro, D. W., & Light, J. (2004). Using visible speech to train perception and production of speech for individuals with hearing loss. Journal of Speech, Language, and Hearing Research, 47(2), 304-320. https://doi.org/10.1044/1092-4388%282004/025%29
- Massaro, D. W., Bigler, S., Chen, T., Perlman, M., & Ouni, S. (2008). Pronunciation training: the role of eye and ear. In Proceedings of Interspeech 2008 (会議論文), 2623-2626. https://doi.org/10.21437/Interspeech.2008-650
最終更新日: 2026-10-04
著者: 中村 拓(Taku Nakamura)(greencafe 編集部 編集責任者・非ネイティブ話者)。公開された 13 件の研究エビデンス(tier 1=13 件 / tier 2=0 件)を横断分析・再構成した。
画像: いらすとや (https://www.irasutoya.com/) より
この記事を編集した人
公開日: / 最終更新:

