Þegar þú skrifar spurningu til mállíkans (large language model, LLM) les það hana ekki eins og manneskja. Það sér hvorki orð né setningar heldur runur af tölum. Þetta hljómar eins og tæknilegt smáatriði en er í raun lykillinn að því að skilja hegðun þessara tóla: af hverju þau svara stundum af fullkomnu öryggi og hafa samt rangt fyrir sér, af hverju góð fyrirmæli breyta öllu og af hverju íslenska er dýrari í notkun en enska. Teymi sem skilur vélina notar hana öðruvísi en teymi sem keypti bara aðgang.
Skref eitt: textinn er brytjaður í tóka
Fyrsta verk líkansins er að skipta textanum í tóka (tokens). Tóki er ekki það sama og orð. Algeng orð verða oft einn tóki, en sjaldgæfari orð eru brotin niður í smærri búta: orðstofna, endingar og jafnvel stök tákn. Orðið "fyrirtækjamenning" gæti til dæmis orðið að þremur til fjórum tókum á meðan enska orðið "culture" verður líklega einn.
Hver tóki fær síðan fast auðkennisnúmer úr orðasafni líkansins. Setningin þín er þar með orðin að talnarunu, til dæmis [4021, 887, 15334, 92]. Þetta er allt sem líkanið fær í hendur: engin orð, engin málfræði, bara röð af númerum.
Skref tvö: tölur sem bera merkingu
Auðkennisnúmerin sjálf segja ekkert um merkingu. Númer 4021 er ekki "skyldara" númeri 4022 en einhverju allt öðru. Þess vegna er hverju númeri breytt í innfellingu (embedding): langan talnavigur, oft með hundruð eða þúsundir vídda, sem líkanið lærði á þjálfunartímanum.
Það merkilega við innfellingar er að þær fanga merkingu í fjarlægðum. Vigrar orðanna "hundur" og "köttur" liggja nálægt hvor öðrum í þessu talnarými, "hundur" og "vaxtastig" liggja langt hvor frá öðrum. Líkanið "veit" ekki hvað hundur er, en það veit að hundur birtist í svipuðu samhengi og köttur í þeim gríðarstóra texta sem það var þjálfað á. Merking, í heimi mállíkana, er staðsetning í talnarými.
Ein aðgerð: að spá fyrir um næsta tóka
Hér kemur það sem kemur flestum á óvart. Undir öllum eiginleikunum, samtölum, samantektum og þýðingum, framkvæmir mállíkan eina og sömu aðgerðina aftur og aftur: það spáir fyrir um næsta tóka út frá þeim sem á undan komu. Á máli líkindafræðinnar reiknar það
$$P(\text{næsti tóki} \mid \text{samhengi})$$
fyrir hvert einasta orðasafnsnúmer, raðar niðurstöðunum í líkindadreifingu (síðasta skrefið í þeim útreikningi kallast softmax, sem breytir hráum tölum í líkur sem leggjast saman í 100%) og velur svo tóka úr dreifingunni. Sá tóki bætist við samhengið og leikurinn endurtekur sig, tóki fyrir tóka, þar til svarið er fullskrifað.
Þetta útskýrir strax tvennt. Í fyrsta lagi: líkanið er ekki að fletta upp staðreyndum, það er að velja líklegt framhald. Þegar líklegasta framhaldið er rétt fáum við snjallt svar. Þegar líklegasta framhaldið er rangt fáum við sannfærandi vitleysu, því setningin er jafn vel skrifuð í báðum tilvikum. Í öðru lagi: allt sem stendur í samhenginu, fyrirmæli, dæmi, gögn sem þú límir inn, breytir dreifingunni $P(\text{næsti tóki} \mid \text{samhengi})$ beint. Góð fyrirmæli eru ekki kurteisi við vélina heldur stærðfræðileg íhlutun í spána.
Íslenska er dýrari en enska, í bókstaflegri merkingu
Tókaskiptingin sjálf er lærð, að mestu af enskum texta, því enska er yfirgnæfandi í þjálfunargögnum stóru líkananna. Afleiðingin er að algeng ensk orð fá sína eigin tóka en íslensk orð brotna niður í fleiri og smærri búta. Sama setning kostar því fleiri tóka á íslensku en á ensku.
Þetta hefur tvenns konar afleiðingar fyrir fyrirtæki. Annars vegar verð: flest mállíkön eru verðlögð eftir tókafjölda, þannig að íslensk notkun kostar hlutfallslega meira fyrir sama efni. Hins vegar gæði: líkan sem sá tiltölulega lítið af íslensku á þjálfunartímanum hefur veikari tilfinningu fyrir beygingum, orðaröð og orðavali en fyrir ensku.
Þess vegna er ekki hægt að ganga út frá því að líkan sem er frábært á ensku sé jafn gott á íslensku. Frammistöðuna verður að mæla. Góðu fréttirnar eru að það er þegar gert: Miðeind heldur úti íslensku stigatöflu (leaderboard) þar sem mállíkön eru borin saman á íslenskum verkefnum. Fyrir fyrirtæki sem velur tól fyrir íslenskumælandi starfsfólk er slík mæling betri grunnur en markaðsefni framleiðendanna.
Hvað útskýrir þetta í daglegri notkun?
Þegar tókar, innfellingar og næsta tóka spá eru komin á hreint verða dagleg fyrirbæri í gervigreindarnotkun skiljanleg:
- Sannfærandi vitleysa er innbyggð, ekki bilun. Líkanið velur alltaf líklegt framhald, líka þegar það hefur engar traustar upplýsingar. Það segir ekki "ég veit það ekki" nema sú setning sé líklegasta framhaldið. Þess vegna er sannreyning á staðreyndum, tölum og tilvísunum vinnuregla, ekki valkvæð varúð.
- Samhengið er stjórntækið þitt. Öll spáin hvílir á samhenginu. Skýr fyrirmæli, rétt gögn og góð dæmi færa líkindadreifinguna í átt að svarinu sem þú vilt. Óljós beiðni skilar meðaltali af internetinu.
- Íslenska krefst sérstakrar athygli. Fleiri tókar þýða hærri kostnað og oft lakari gæði en á ensku. Veldu tól út frá mældri frammistöðu á íslensku, ekki út frá enskum kynningarmyndböndum.
Þetta er munurinn á þjálfuðu teymi og tólakaupanda. Tólakaupandinn undrast þegar líkanið "lýgur". Þjálfaða teymið veit að það var aldrei að segja satt eða ósatt, það var að spá fyrir um tóka, og hagar vinnubrögðum sínum eftir því.
Það sem þú getur gert strax
- Prófaðu tókateljara. Framleiðendur stóru líkananna bjóða upp á ókeypis tókateljara á vefnum. Límdu inn sömu málsgrein á íslensku og ensku og berðu saman tókafjöldann. Fimm mínútna æfing sem gerir verðlagningu og samhengisstærðir áþreifanlegar.
- Settu sannreyningu inn í verkflæðið, ekki í minnið. Ákveddu með teyminu hvaða tegundir úttaks þarf alltaf að sannreyna: tölur, nöfn, lagatilvísanir, verð. Skrifleg regla heldur, "munum að tékka" gerir það ekki.
- Skoðaðu íslensku stigatöflu Miðeindar áður en þú velur tól. Ef starfsfólkið þitt vinnur á íslensku er frammistaða á íslensku forsendan, ekki aukaatriði. Mælingin er til, notaðu hana.
[ Hafa samband ]
Bókaðu frítt stöðumat
90 mínútur sem borga sig strax: við kortleggjum gervigreindarnotkun, áhættur og 3 til 5 sjálfvirknivæðanleg verkflæði og skilum skýrslu innan viku. Engin skuldbinding.