Обработка естественного языка (NLP) — это не магия. Это раздел информатики, позволяющий машинам имитировать человеческое общение. Цель проста, но реализация сурова. Компьютеры должны разбирать написанные и произнесенные слова с помощью вычислительной лингвистики, статистики и глубокого обучения. Они не думают. Они вычисляют вероятности.
Ранние попытки опирались на правила, закодированные вручную. Они потерпели неудачу, потому что им не хватало нюансов. Человеческий язык хаотичен. Сарказм. Идиомы. Метафоры. Эти концепции усваиваются через опыт. Машине требуется явное программирование для их различения. Ранние модели не могли обрабатывать исключения. Результатом была жесткая, роботизированная генерация текста.
Затем появился статистический NLP. Этот подход использовал вероятность для присвоения смысла фрагментам текста. Это был шаг вперед. Современные системы идут дальше. Они используют модели глубокого обучения для «обучения» паттернам в процессе обработки данных. Это не понимание. Это сложное программирование, генерирующее ответы, похожие на человеческие. Машина предсказывает следующее наиболее вероятное слово. Она не знает правды.
«Такие системы нельзя назвать «понимающими» то, что они анализируют; скорее, они используют сложное программирование и вероятность для генерации ответов, похожих на человеческие.»
Появление больших языковых моделей изменило все. Эти системы искусственного интеллекта предсказывают окончания предложений на основе существующего текста. GPT-3, выпущенная компанией OpenAI в июне 2020 года, стала знаковым событием. Она могла решать задачи по математике школьного уровня. Она писала компьютерный код. Это была одна из первых больших языковых моделей, продемонстрировавших такой диапазон возможностей.
ChatGPT был запущен в ноябре 2022 года. Он был построен на этом фундаменте. Реакция была немедленным шоком. Академики и журналисты были обеспокоены. Письменный текст неотличим от человеческого. Грань между сгенерированным контентом и человеческим мышлением стерлась за одну ночь.
Но NLP — это не только чат-боты. Он присутствует в навигаторе вашего автомобиля. Он питает голосовые системы управления. Чат-боты службы поддержки клиентов полагаются на него. Программы для перевода используют его ежедневно. Бизнес использует его для автозавершения поисковых запросов. Он отслеживает социальные сети, чтобы понимать потребителей. Эта технология повсюду. Она просто менее заметна.
Эта заметность несет в себе риски. Предвзятость — серьезная проблема. Алгоритмы машинного обучения отражают свои обучающие данные. Если данные смещены, то и результат будет смещенным. Попросите модель NLP описать врача. Она может по умолчанию использовать «Он врач». Она может игнорировать «Она врач». Это врожденная гендерная предвзятость. Это не ошибка в коде. Это ошибка в данных.
Последствия реальны. В 2015 году программа Amazon по отбору резюме на основе NLP дала сбой. Она дискриминировала женщин. Модель была обучена на резюме мужчин, доминирующих в определенных ролях. Она научилась считать, что женщины менее квалифицированы. Она наказывала их за это. Это не было злонамеренностью. Это была вероятность.
Есть и другая проблема. Галлюцинации. Модели, основанные на вероятности, такие как ChatGPT, избегают говорить «Я не знаю». Они отвечают вероятным текстом. Этот текст часто бывает фактологически неверным. Модель генерирует ложь, потому что она звучит правдоподобно. Она не проверяет факты. Она просто продолжает паттерн.
Мы передаем этим системам все больше задач. Написание текстов. Программирование. Найм сотрудников. Вождение автомобиля. Мы доверяем им, потому что они звучат по-человечески. Но они лишь вычисляют вероятности. Разрыв между тем, чтобы звучать как человек, и тем, чтобы быть человеком, расширяется. Или, возможно, его никогда не существовало. Мы просто хотим верить в его существование.
