Zpracování přirozeného jazyka (NLP) není kouzlo. Jedná se o obor informatiky, který umožňuje strojům napodobovat lidskou komunikaci. Cíl je jednoduchý, ale realizace je tvrdá. Počítače musí analyzovat psaná a mluvená slova pomocí výpočetní lingvistiky, statistiky a hlubokého učení. Nemyslí. Počítají pravděpodobnosti.
První pokusy se spoléhaly na ručně kódovaná pravidla. Selhali, protože jim chyběly nuance. Lidský jazyk je chaotický. Sarkasmus. Idiomy. Metafory. Tyto pojmy se učí zkušenostmi. Stroj vyžaduje explicitní programování, aby je bylo možné rozlišit. První modely nezvládaly výjimky. Výsledkem bylo brutální, robotické generování textu.
Pak přišlo statistické NLP. Tento přístup používal pravděpodobnost k přiřazení významu kouskům textu. To byl krok vpřed. Moderní systémy jdou dále. Používají modely hlubokého učení k „učení se“ vzorcům při zpracování dat. To není pochopení. Jedná se o složité programování, které generuje reakce podobné lidem. Stroj předpovídá další nejpravděpodobnější slovo. Ona nezná pravdu.
“Takové systémy nelze nazvat “chápáním” toho, co analyzují; spíše používají sofistikované programování a pravděpodobnost, aby generovaly reakce podobné lidem.”
Nástup velkých jazykových modelů vše změnil. Tyto systémy umělé inteligence předpovídají konce vět na základě existujícího textu. GPT-3, vydaný OpenAI v červnu 2020, byl mezníkem ve vývoji. Uměla řešit matematické úlohy na úrovni školy. Napsala počítačový kód. Byl to jeden z prvních velkých jazykových modelů, které demonstrovaly tento rozsah schopností.
ChatGPT byl spuštěn v listopadu 2022. Na tomto základu byl postaven. Reakcí byl okamžitý šok. Akademici a novináři byli znepokojeni. Psaný text je k nerozeznání od lidského. Hranice mezi generovaným obsahem a lidským myšlením se přes noc smazala.
NLP ale není jen o chatbotech. Je přítomen v navigátoru vašeho auta. Pohání systémy hlasového ovládání. Chatboti zákaznických služeb na to spoléhají. Překladatelské programy jej používají každý den. Firmy jej využívají k automatickému doplňování vyhledávacích dotazů. Sleduje sociální sítě, aby porozuměl spotřebitelům. Tato technologie je všude. Jen je to méně nápadné.
Tato viditelnost s sebou nese rizika. Zaujatost je vážný problém. Algoritmy strojového učení odrážejí jejich tréninková data. Pokud jsou data zkreslená, bude zkreslený i výsledek. Požádejte model NLP, aby popsal lékaře. Mohla by předvolit “On je doktor.” Může ignorovat “Je to doktor.” Jde o vrozenou genderovou předpojatost. Toto není chyba v kódu. Toto je chyba dat.
Následky jsou reálné. V roce 2015 selhal program pro screening životopisů Amazon založený na NLP. Diskriminovala ženy. Model byl vyškolen na životopisech mužů, kteří jsou dominantní v určitých rolích. Naučila se věřit, že ženy jsou méně kvalifikované. Za to je potrestala. To nebylo zlomyslné. Byla to možnost.
Je tu další problém. Halucinace. Modely založené na pravděpodobnosti, jako je ChatGPT, se vyhýbají tvrzení „nevím“. Odpovídají pravděpodobným textem. Tento text je často věcně nesprávný. Model generuje lži, protože to zní věrohodně. Nekontroluje fakta. Prostě pokračuje ve vzoru.
Do těchto systémů přenášíme stále více úkolů. Psaní textů. Programování. Najímání zaměstnanců. Řízení. Věříme jim, protože zní lidsky. Ale počítají pouze pravděpodobnosti. Propast mezi znějícím člověkem a člověkem se prohlubuje. Nebo možná nikdy neexistoval. Chceme jen věřit v jeho existenci.


















