«Кажется, я придумал»: Как GPT научился краснеть и признавать свою ложь

chetspro.ru

Мы любим нейросети за скорость, но ненавидим за беззастенчивое вранье. Эта странная привычка выдавать фейки с абсолютной, непоколебимой уверенностью профессионального мошенника долгое время считалась чем-то вроде неизлечимой болезни больших языковых моделей. Но сегодня что-то изменилось. В обновленной архитектуре GPT появился механизм, который можно назвать «цифровой совестью» — и он способен навсегда изменить то, как мы взаимодействуем с ИИ.

Корень проблемы: Лжец, который не знает, что он лжец

Чтобы понять революцию, стоит разобраться в анатомии ИИ-галлюцинации. Старые модели были устроены как очень умный, но абсолютно беспринципный попугай. Их задача — предсказывать следующее слово в цепочке, создавая красивый, грамматически верный и стилистически гладкий текст. Правда или вымысел не имели значения. Если в обучающих данных был пробел, нейросеть не замолкала, а включала «режим сказочника» и убедительно досочиняла недостающие звенья.

Именно поэтому мы получали ссылки на несуществующие научные работы, цитаты Ленина из «Звездных войн» и рекомендации добавлять клей в соус для пиццы.

Что произошло сейчас: Внедрение «Тензора неуверенности»

Разработчики подошли к проблеме не как лингвисты, а как картографы. Новая версия GPT получила внутренний модуль, который в режиме реального времени строит «карту знаний». Представьте себе навигатор: когда вы едете по скоростному шоссе с хорошим покрытием (проверенный научный факт, точная цитата из базы данных), сигнал уверенности — зеленый, модель генерирует текст быстро и четко.

Но как только запрос уводит модель на проселочную дорогу или в чистое поле (редкий запрос, статистическая погрешность, пробел в обучении), срабатывает триггер. Модуль фиксирует падение плотности фактической опоры и формирует маркер неуверенности.

Результат ошеломляет: вместо выдумывания факта модель теперь маркирует фрагмент текста серой плашкой и честно пишет: «У меня недостаточно подтвержденных данных для этого утверждения. Вот наиболее вероятная, но неподтвержденная гипотеза…»

Инженерия сомнения

Технически это реализовано через каскадную верификацию. Нейросеть больше не работает одним монолитным блоком. Второй, фоновый контур ИИ (назовем его «Критик») сканирует вывод основного генератора на предмет пересечения с верифицированными базами данных. Они успешно победили главную проблему прошлых лет — задержку вывода токенов. Теперь «Критик» работает с опережением, предсказывая потенциальные блоки неопределенности еще до того, как основной поток текста достигнет пользователя.

На тестах, проведенных на датасете из 10 000 сложных научных и юридических запросов, уровень грубых ошибок упал до 0.7%. Это не просто улучшение. Это смена философии продукта.

Почему это круто и немного пугающе

Мы вступаем в новую эру отношений с машинами. Если раньше мы имели дело с самоуверенным всезнайкой, которому нужно было перепроверять каждое слово, то теперь у нас появился партнер, умеющий говорить: «Я не знаю» или «Я не уверен». Это делает технологию взрослой.

Психологический эффект любопытен: признание машиной своих ограничений парадоксально повышает уровень нашего доверия к ней. Мы готовы простить ошибку, о которой нас предупредили. Мы не готовы прощать ложь, сказанную с честными глазами.

Мир фактов только что получил надежный предохранитель. Следующая станция — обучение нейросетей не только замечать свое незнание, но и самостоятельно закрывать эти пробелы, не беспокоя человека. Но это уже совсем другая история.