Исследователи из Окинавского института науки и технологий (OIST) представили новую систему искусственного интеллекта, которая учится понимать язык по принципам, больше напоминающим развитие ребенка, чем традиционное машинное обучение. Вместо механического заучивания алгоритм получает внутреннюю мотивацию исследовать окружающую среду, что позволило виртуальным роботам освоить языковые задачи почти в два раза быстрее по сравнению с классическими методами обучения.

В основе разработки лежит архитектура PV-RNN — вариационная рекуррентная нейронная сеть, созданная по мотивам принципов работы человеческого мозга. В отличие от больших языковых моделей, предсказывающих следующее слово на основе огромных массивов текста, новая система постоянно сопоставляет свои ожидания с происходящим, обновляя внутреннюю модель окружающего мира только тогда, когда сталкивается с чем-то новым или неожиданным.

Чтобы усилить исследовательское поведение, ученые объединили эту архитектуру с обучением с подкреплением. Роботы получали награду не только за правильное выполнение языковых заданий, но и за проявление любопытства — изучение незнакомых ситуаций и поиск новых способов взаимодействия с объектами. Именно этот баланс между стремлением к стабильности и желанием исследовать оказался наиболее эффективным.

Во время экспериментов исследователи заметили любопытный эффект: даже после успешного освоения заданий виртуальные роботы продолжали взаимодействовать с окружающими объектами без каких-либо дополнительных указаний. Они экспериментировали с предметами и проверяли новые варианты поведения, словно играли. По мнению авторов работы, именно такая спонтанная исследовательская активность существенно ускоряет освоение языка и может объяснять, почему игра играет столь важную роль в развитии детей.

Исследование также позволило по-новому взглянуть на одну из самых известных проблем современной лингвистики — гипотезу Ноама Хомского о «недостатке стимула», согласно которой дети способны осваивать язык, имея лишь ограниченное количество примеров. Выяснилось, что одного любопытства недостаточно: для успешного обучения необходима богатая и разнообразная языковая среда. Чем больше различных языковых конструкций получали роботы во время обучения, тем лучше они понимали незнакомые команды и переносили полученные знания на новые ситуации.

Еще одним неожиданным результатом стало появление эффекта, давно наблюдаемого у маленьких детей. Сначала роботы успешно запоминали языковые исключения, затем временно начинали ошибаться, чрезмерно распространяя общие правила, а после вновь возвращались к правильным ответам. Подобная U-образная кривая развития считается одной из характерных особенностей освоения человеческой речи и возникла у модели без каких-либо специальных алгоритмов для обработки исключений.

Авторы исследования отмечают, что прозрачная архитектура PV-RNN позволяет наблюдать за тем, как искусственный интеллект принимает решения и изменяет свои внутренние представления в режиме реального времени. Это делает систему не только перспективной основой для создания более адаптивного ИИ, но и удобной научной моделью для изучения механизмов человеческого мышления и освоения языка.