Обробка природної мови (NLP) – це не магія. Це розділ інформатики, який дозволяє машинам імітувати людське спілкування. Мета проста, але реалізація сувора. Комп’ютери повинні розбирати написані та вимовлені слова за допомогою обчислювальної лінгвістики, статистики та глибокого навчання. Вони не гадають. Вони обчислюють ймовірність.
Ранні спроби спиралися на правила, закодовані вручну. Вони зазнали невдачі, бо їм не вистачало нюансів. Людська мова хаотична. Сарказм. Ідіоми. Метафори. Ці концепції засвоюються через досвід. Машині потрібно явне програмування їхнього розрізнення. Ранні моделі не могли обробляти виняток. Результатом була жорстка роботизована генерація тексту.
Потім виник статистичний NLP. Цей підхід використовував ймовірність присвоєння сенсу фрагментам тексту. То був крок уперед. Сучасні системи йдуть далі. Вони використовують моделі глибокого навчання для «навчання» патернам у процесі обробки даних. Це не розуміння. Це складне програмування, що генерує відповіді, схожі на людські. Машина передбачає наступне найбільш ймовірне слово. Вона не знає правди.
«Такі системи не можна назвати «розуміючими» те, що вони аналізують; швидше, вони використовують складне програмування та ймовірність для генерації відповідей, схожих на людські.
Поява великих мовних моделей змінила все. Ці системи штучного інтелекту пророкують закінчення речень на основі існуючого тексту. GPT-3, випущена компанією OpenAI у червні 2020 року, стала знаковою подією. Вона могла вирішувати завдання з математики шкільного рівня. Вона писала комп’ютерний код. Це була одна з перших великих мовних моделей, які продемонстрували такий діапазон можливостей.
ChatGPT було запущено у листопаді 2022 року. Він був збудований на цьому фундаменті. Реакція була негайним шоком. Академіки та журналісти були стурбовані. Письмовий текст не відрізняється від людського. Грань між згенерованим контентом та людським мисленням стерлася за одну ніч.
Але NLP – це не лише чат-боти. Він присутній у навігаторі вашого автомобіля. Він живить голосові системи керування. Чат-боти служби підтримки клієнтів покладаються на нього. Програми перекладу використовують його щодня. Бізнес використовує його для автозавершення пошукових запитів. Він відстежує соціальні мережі, аби розуміти споживачів. Ця технологія всюди. Вона просто менш помітна.
Ця помітність несе у собі ризики. Упередженість – серйозна проблема. Алгоритми машинного навчання відбивають свої навчальні дані. Якщо дані зміщені, то результат буде зміщеним. Попросіть NLP описати лікаря. Вона може за умовчанням використовувати “Він лікар”. Вона може ігнорувати “Вона лікар”. Це вроджена гендерна упередженість. Це не помилка у коді. Це помилка даних.
Наслідки є реальними. У 2015 році програма Amazon із відбору резюме на основі NLP дала збій. Вона дискримінувала жінок. Модель була навчена на резюме чоловіків, які домінують у певних ролях. Вона навчилася вважати, що жінки менш кваліфіковані. Вона карала їх за це. Це не було зловмисністю. Це була можливість.
Є й інша проблема. Галюцинації. Моделі, що ґрунтуються на ймовірності, такі як ChatGPT, уникають говорити «Я не знаю». Вони відповідають можливим текстом. Цей текст часто буває невірним. Модель генерує брехню, бо вона звучить правдоподібно. Вона не перевіряє фактів. Вона просто продовжує патерн.
Ми передаємо цим системам дедалі більше завдань. Написання текстів. Програмування. Найм співробітників. Водіння автомобіля. Ми їм довіряємо, бо вони звучать по-людськи. Але вони лише обчислюють ймовірність. Розрив тим часом, щоб звучати як людина, і тим, щоб бути людиною, розширюється. Або, можливо, його ніколи не було. Ми просто хочемо вірити у його існування.
