Если вы хоть раз записывали фразу в голосовой режим чат-бота и просили оценить произношение, вы наверняка получали аккуратный разбор: какой звук не удался, где сместилось ударение, что стоит поправить. Такой ответ звучит как слова преподавателя, и ему хочется верить. На том же механизме строится всё больше приложений для тренировки речи: запись уходит в большую языковую модель, а обратно приходит текст с диагнозом. С этого наблюдения начинается исследование Rong Wang из Тюбингенского университета и Kun Sun из Университета Тунцзи, опубликованное в июне 2026 года.
Large language models are increasingly deployed for written pronunciation feedback in second-language (L2) English learning, under the assumption that their diagnoses are grounded in the supplied speech evidence rather than in priors from pretraining.
Большие языковые модели всё чаще используют для письменной обратной связи по произношению в изучении английского как второго языка, исходя из допущения, что их диагноз опирается на предоставленную запись речи, а не на ожидания, усвоенные при обучении.
Иначе говоря, все надеются, что модель слушает именно вас. Но у LLM есть второй источник знаний: из огромного количества текстов об изучении английского она знает, какие ошибки «обычно» делают иностранцы, и может выдать их, даже не вслушиваясь. Снаружи эти два режима не различить, и авторы говорят об этом прямо.
A grounded model and a prior-driven model are externally indistinguishable: both produce confident, fluent prose.
Модель, которая опирается на данные, и модель, которая опирается на заученные ожидания, внешне неразличимы: обе выдают уверенный и гладкий текст.
Важно различать два типа систем. Универсальная LLM учится на текстах и умеет рассуждать о чём угодно, включая произношение. Специализированная система разбора речи учится на записях и сравнивает ваше произнесение с эталоном. Исследование проверяло первый тип.
Как исследователи проверяли LLM
Исследователи взяли корпус L2-ARCTIC, в котором 24 человека с шестью родными языками (арабским, хинди, корейским, китайским, испанским и вьетнамским) читают английские фразы, а лингвисты вручную отметили каждую ошибку в звуках и ударении. Из корпуса отобрали 1800 фраз и отдали их трём универсальным моделям, которые умеют работать с аудио: Gemini 3.0 Flash, GPT-4o и Qwen 3.5 Omni.
Каждая модель оценивала четыре стороны речи: темп, мелодику, ударение и отдельные звуки. Причём она не только ставила оценку, но и объясняла её, называя конкретные звуки или цифры, на которые опиралась. Входные данные меняли от минимальных, когда модель видела только текст фразы, родной язык и пол говорящего, до полных, когда она получала саму запись вместе с измеренными по ней параметрами голоса. Затем каждое объяснение сверяли с ручной разметкой: лингвисты оценили произношение каждого говорящего сами, заранее и независимо от моделей. Так удалось отделить убедительный ответ от верного.
Можно ли доверять LLM оценку произношения?
Судя по исследованию, пока нет: из логичных объяснений, которые давали LLM, больше двух третей вели к неверному выводу. В 55% ответов модели давали связное объяснение, но только в 16% случаев оно подкрепляло верную оценку, а в 40% за ним стоял неправильный вывод.
39.6% of judged cells contain internally coherent reasoning that supports a wrong rating, against only 15.8% where the reasoning supports a correct rating.
В 39,6% проверенных случаев внутренне связное рассуждение подкрепляет неверную оценку, и лишь в 15,8% рассуждение подкрепляет верную.
Для ученика это самая неудобная разновидность ошибки. Если приложение молчит, вы хотя бы продолжаете искать проблему сами. Если оно уверенно указывает не туда, вы тратите неделю тренировок на звук, который у вас и так в порядке, а настоящая ошибка остаётся на месте.
Misdirected feedback is more costly than no feedback because it consumes learner attention that would otherwise go to the real error.
Обратная связь, которая указывает не туда, обходится дороже, чем её отсутствие, потому что забирает внимание ученика, которое иначе ушло бы на настоящую ошибку.
Почему LLM говорит всем, что у них проблема с th?
Потому что LLM называет ошибки по стереотипу, а не по записи вашего голоса: для говорящих на шести разных языках модели назвали одни и те же четыре звука. Если бы они действительно слушали запись, у говорящих на испанском и на корейском находились бы разные ошибки, ведь у каждого родного языка свои ловушки, и лингвисты описывают их с середины прошлого века. На деле в верхней части списка для всех оказались /θ/ как в think, /ð/ как в this, /r/ и /v/. На /θ/, /ð/ и /r/ пришлась треть всех ошибок, которые называли модели, хотя среди реальных ошибок их около 20%. Картина не менялась и тогда, когда модели получали саму запись.
При этом формальная точность выглядит отлично, около 95%. Объяснение простое: хоть одна неточность есть в 96% фраз, и ответ «ошибка есть» почти всегда совпадает с правдой. А вот назвать, в каком именно звуке она сидит, модели не могут, и тем более не могут научить произносить его правильно и проверить ваш прогресс.
The model can detect that some error exists but cannot ground which phone was mispronounced.
Модель может определить, что какая-то ошибка есть, но не может обосновать, какой именно звук произнесён неправильно.
Для русскоязычных учеников это особенно коварно. Межзубные звуки и английский /r/ нам действительно даются тяжело, поэтому стереотипный ответ выглядит правдоподобно, и заметить, что модель вас не слушала, гораздо труднее. Если вы уже поставили th, вам всё равно будут про него напоминать.
Почему LLM находит ошибки в ударении почти у всех?
Потому что модель видит пометку «иностранец» и ставит ошибку заранее. Уже в самом простом режиме, когда LLM видела только текст фразы и сведения о говорящем, она отмечала ошибку в ударении в 82–96% фраз, хотя на самом деле ошибка была в 4%.
Чтобы проверить, откуда берётся перекос, исследователи провели простой опыт: оставили модели те же данные, но запретили опираться на родной язык и пол говорящего. Если бы LLM действительно слушала запись, от такого запрета ничего бы не изменилось. Изменилось многое: точность оценки ударения выросла в несколько раз, с 0,08–0,14 до 0,40–0,65 по шкале от нуля до единицы.
Obviously, the model was not listening to the speech; it was seeing “L2 learner” and assuming errors.
Очевидно, модель не слушала речь: она видела пометку «изучает английский как второй язык» и заранее предполагала ошибки.
Ещё нагляднее это видно на мелодике речи. Среди стереотипов, которые модели усвоили из текстов, есть и такой: мужчины говорят монотонно. Пока пол говорящего был виден, LLM так и отвечали, называя мужчин монотонными даже тогда, когда разметка показывала живую интонацию. Мелодику женских голосов модели оценивали точнее, чем мужских, на 0,16–0,24 пункта по той же шкале. Когда пол скрыли, разрыв перевернулся: теперь на 0,13–0,27 пункта точнее стали оценки мужчин. Голоса остались теми же, а стереотип исчез вместе с пометкой.
The model was responding to the gender tag, not to the speaker’s actual pitch.
Модель реагировала на пометку пола, а не на реальную высоту голоса говорящего.
Помогает ли LLM, если дать ей саму запись?
Почти нет: обоснованных ответов прибавлялось, только когда модель получала измерения, посчитанные из записи отдельной программой. Лучше всего это видно на мелодике речи. С одной записью доля обоснованных оценок почти не росла. Когда же модели давали минимальную и максимальную высоту голоса числами, стереотипный ответ «монотонно» почти исчез, а доля обоснованных оценок выросла с 0,18 до 0,45–0,62.
The same audio waveform without textualised F0 values does not reproduce the lift.
Та же звуковая волна без значений высоты голоса, записанных текстом, такого роста не даёт.
С ударением и отдельными звуками не помогли никакие данные. Чтобы понять, где ошибка, нужно сопоставить, как слово должно звучать, с тем, как вы его произнесли на самом деле, звук за звуком. Ни запись целиком, ни общие цифры по фразе такого сопоставления не содержат, и модель заполняет пробел тем, что знает об иностранцах вообще.
When explicit acoustic evidence is absent or difficult to parse, LLMs do not fail gracefully by expressing uncertainty; instead, they default to demographic and pedagogical priors ingrained during pretraining.
Когда явных акустических данных нет или их трудно разобрать, языковые модели не признают свою неуверенность, а откатываются к демографическим и педагогическим стереотипам, усвоенным при обучении.
Какому ИИ-разбору произношения можно доверять?
Тому, где ошибку находит специализированная система, которая сравнивает ваше произнесение с эталоном, а языковая модель только объясняет результат понятными словами. Авторы исследования не предлагают отказаться от LLM, они предлагают поменять её роль.
A more robust design uses specialised acoustic models for target-to-realisation alignment and deploys LLMs strictly as downstream natural-language interfaces.
Более надёжная архитектура использует специализированные акустические модели, чтобы сопоставлять эталон с реальным произнесением, а языковые модели оставляет только как интерфейс, который переводит результат на человеческий язык.
BClear Lab тоже использует ИИ, но ошибку в нём находит не языковая модель, а сравнение вашей попытки с эталоном (это собственная технология на основе компьютерного зрения и моделей анализа звуковой волны): камера фиксирует положение губ и челюсти, а звук сверяется с образцом. Вы повторяете фразу за эталоном, и подсказка появляется из этого сравнения, поэтому она касается вашей попытки, а не типичного иностранца: если губы недостаточно округлились на /uː/, вы узнаете именно это. Ваш родной язык и пол в разбор не попадают, потому что, как показало исследование, такие пометки перевешивают саму запись.
Камера добавляет то, чего нет даже у хорошей акустической модели. Звук показывает результат, а положение губ и челюсти показывает причину, поэтому вместо оценки «звук неточный» вы получаете инструкцию, что сделать ртом в следующей попытке. Чем такой подход отличается от других приложений, подробно написано на странице сравнения.
Как проверить, слушает ли вас ИИ-репетитор?
Попросите его назвать звук, в котором вы ошиблись, и проверьте ответ на звуке, который у вас уже получается хорошо. Если репетитор продолжает его критиковать, он слушает не вас, а свои ожидания. Высокая общая точность здесь ничего не доказывает, и авторы исследования называют её иллюзией.
High F1 is an illusion of competence.
Высокий F1 (так называется одна из метрик точности) создаёт иллюзию компетентности.
Поэтому спрашивайте не о том, насколько точно приложение оценивает речь, а о том, может ли оно назвать звук, в котором вы ошиблись, и объяснить, что сделать иначе. Этот же тест мы предлагаем применять и к нам.
BClear Lab устроен так, чтобы его проходить. Универсальный ИИ-чат или приложение, построенное на LLM, получает вашу запись и во многом пересказывает, какие ошибки обычно делают русскоязычные. Наш тренажёр сравнивает конкретную попытку с эталоном и через камеру видит, что при этом делали губы и челюсть. Поэтому он может сказать то, чего LLM не умеет: в каком звуке ошибка, что сделать ртом, чтобы её исправить, и получилось ли у вас в следующей попытке. Если th у вас уже получается, мы не станем про него напоминать и займёмся тем звуком, который действительно мешает вас понимать.
Исследование: Rong Wang, Kun Sun. Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback. arXiv:2606.15325, 2026. Цитаты приведены в оригинале и в нашем переводе.
Хотите попробовать первыми?
Мы открываем доступ небольшими группами, чтобы успевать поговорить с каждым, кто пришел, и чинить то, что мешает заниматься каждый день. Оставьте почту — напишем, когда придет ваша очередь.
