Техно

Тест Тьюринга: есть ли разум по ту сторону экрана?

В 1950 году британский математик Алан Тьюринг начал свою знаменитую статью «Computing Machinery and Intelligence» с вопроса, который сегодня звучит подозрительно современно: «Могут ли машины мыслить?» А затем практически сразу объяснил, что вопрос этот ему не нравится. Сначала пришлось бы договориться, что такое «машина», потом выяснить, что значит «мыслить», после чего философы могли бы провести ещё несколько столетий в приятной дискуссии и ни к чему не прийти. Поэтому Тьюринг предложил гораздо более практичную вещь: не заглядывать машине в электронную душу, а посмотреть, как она себя ведёт.

Так появилась знаменитая «игра в имитацию», которую позднее стали называть тестом Тьюринга. Человек-судья общается посредством текста с двумя невидимыми собеседниками. Один из них человек, другой — компьютер. Можно задавать любые вопросы, спорить, шутить, проверять знания, пытаться поймать собеседника на нелепости. Если определить, кто есть кто, становится достаточно трудно, машина демонстрирует поведение, которое мы обычно называем разумным.

Причём Тьюринг прекрасно понимал, что компьютер вовсе не обязан вести себя как идеальный калькулятор. Наоборот, слишком правильные ответы могут его выдать. В статье он специально замечал, что машина при необходимости вполне может намеренно ошибиться в арифметике. Получается довольно забавная ситуация: одним из признаков искусственного интеллекта оказывается способность вовремя прикинуться немного глупее, чем он есть. Человечество, вероятно, должно было насторожиться уже тогда.

С тестом связан очень живучий миф. Часто утверждают, будто Тьюринг установил точное правило: компьютер «проходит тест», если сумеет убедить 30% людей, что он человек. На самом деле никакого такого официального порога он не вводил. Тьюринг сделал прогноз. Он предположил, что примерно через пятьдесят лет, то есть около 2000 года, компьютеры смогут играть в эту игру настолько хорошо, что после пяти минут разговора средний судья будет правильно определять машину не более чем в 70% случаев.

Прогноз оказался удивительно близким по духу, хотя развитие техники пошло совсем не так, как представляли в 1950-м. Сам Тьюринг рассуждал о компьютерах с памятью примерно миллиард бит — сегодня такая величина выглядит почти трогательно. Современный смартфон располагает памятью, которая превосходит этот масштаб на многие порядки, а большие языковые модели работают на вычислительной инфраструктуре, которую трудно было бы объяснить даже инженерам первой компьютерной эпохи без длинной лекции и нескольких чашек чая.

Первая большая сенсация случилась в 2014 году. Программа Eugene Goostman изображала 13-летнего украинского мальчика из Одессы и во время мероприятия в лондонском Королевском обществе убедила 10 из 30 судей, то есть 33%, что перед ними человек. Заголовки немедленно объявили: тест Тьюринга пройден впервые в истории.

Праздник длился недолго. Учёные начали указывать на маленькую хитрость: Eugene изображал подростка, для которого английский язык не был родным. Поэтому странные ответы, непонимание вопросов и пробелы в знаниях легко объяснялись возрастом и происхождением персонажа. Один из создателей программы фактически признавал привлекательность этого решения: тринадцатилетнему мальчику совершенно необязательно знать всё на свете. Получался прекрасный способ превратить недостатки чат-бота в особенности характера.

Тем не менее идея оказалась пророческой. Спустя десять лет спорить с машиной стало гораздо сложнее. В опубликованном в 2025 году эксперименте исследователи Кэмерон Джонс и Бенджамин Берген провели контролируемую версию классического трёхстороннего теста. Участники разговаривали пять минут одновременно с человеком и системой искусственного интеллекта, после чего должны были определить, кто из них настоящий человек.

Результат выглядел почти издевательски. GPT-4.5, получив инструкцию изображать определённую человеческую личность, была названа человеком в 73% случаев. Иными словами, участники выбирали машину чаще, чем настоящего человека. Другая модель, LLaMA 3.1-405B, показала 56%. Для сравнения, старенькая ELIZA, созданная ещё в 1960-х, получила около 23%.

И вот здесь тест Тьюринга неожиданно столкнулся с собственной победой. Пока компьютеры не могли его пройти, тест казался невероятно высокой планкой искусственного интеллекта. Как только они научились это делать, возник вопрос: а что именно мы измеряем? В 2025 году журнал Nature сформулировал проблему почти беспощадно: современные языковые модели фактически «убили» тест Тьюринга, потому что имитация человека оказалась вовсе не равна интеллекту.

Эта проблема появилась задолго до ChatGPT. В 1966 году Джозеф Вейценбаум создал программу ELIZA, имитировавшую психотерапевта. Она пользовалась примитивными правилами: находила ключевые слова и превращала высказывания пользователя в вопросы. Человек говорил: «Мне плохо». Машина отвечала чем-нибудь вроде: «Почему вам плохо?» Никакого понимания происходящего у программы не было, но некоторые пользователи начинали воспринимать её почти как живого собеседника.

Вейценбаум был настолько поражён человеческой готовностью приписывать машине понимание, что впоследствии стал одним из заметных критиков чрезмерной веры в искусственный интеллект. Сегодня этот психологический эффект выглядит особенно актуальным. Нам достаточно нескольких убедительных фраз, паузы в нужном месте и лёгкой шутки, чтобы мозг немедленно начал дорисовывать собеседнику личность, намерения и даже эмоции.

Самая знаменитая философская атака на тест появилась в 1980 году. Американский философ Джон Сёрл предложил мысленный эксперимент под названием «китайская комната». Представьте человека, который совершенно не знает китайского языка. Его запирают в комнате и дают огромную инструкцию: увидел такие иероглифы — выдай такие. Снаружи китайцы посылают вопросы, внутри человек механически следует инструкции, а ответы получаются настолько хорошими, что окружающие решают: в комнате находится человек, прекрасно понимающий китайский.

Но понимает ли он хоть слово? Нет. По мнению Сёрла, именно это происходит и с компьютером. Он может великолепно манипулировать символами и при этом ничего не понимать. Синтаксис ещё не означает семантику, а убедительный ответ сам по себе не доказывает наличия внутреннего опыта.

За следующие десятилетия философы придумали множество возражений Сёрлу. Например: возможно, китайского не понимает человек внутри комнаты, зато его понимает система целиком — человек, инструкции, память и механизм обработки информации. В конце концов, отдельный нейрон человеческого мозга тоже не понимает китайского языка, однако несколько десятков миллиардов нейронов каким-то образом способны обсуждать Конфуция.

Поэтому главный вопрос теста Тьюринга постепенно изменился. В 1950 году он звучал примерно так: сможет ли машина вести себя настолько разумно, что мы перестанем отличать её от человека? Сегодня ответ, похоже, уже да. Но из этого совершенно не следует, что машина обладает сознанием, чувствами или человеческим пониманием мира.

Более того, современному искусственному интеллекту иногда приходится специально становиться менее совершенным, чтобы казаться человеком. Слишком быстрые ответы подозрительны. Безупречная грамматика подозрительна. Энциклопедические знания тоже подозрительны. Машине приходится добавлять разговорные обороты, сомнения, паузы и иногда даже ошибки — почти точно так, как Тьюринг предполагал ещё в 1950 году.

Получается прекрасный исторический парадокс. Семьдесят пять лет человечество пыталось создать компьютер, способный пройти тест Тьюринга. Когда это наконец стало возможным, выяснилось, что победить в игре проще, чем ответить на первоначальный вопрос.

Машина уже может убедить нас, что с другой стороны экрана сидит человек. Но мыслит ли она? На этот вопрос у нас по-прежнему нет теста. И, возможно, именно это Тьюринг понимал лучше многих своих последователей.