Ievads
Lielākā daļa uzņēmumu, kas testē mākslīgo intelektu klientu atbalsta jomā, sastopas ar vienu un to pašu problēmu. Sistēma nedēļām darbojas nevainojami. Tad tā vienam klientam sniedz pārliecinošu, bet pilnīgi nepareizu atbildi. Varbūt par naudas atmaksas termiņu. Varbūt par noteikumiem, kas mainījās pagājušajā ceturksnī. Kāds augstākstāvošs darbinieks to pamanī, un ieviešana, kas bija paredzēta lielākajai daļai klientu rindas, klusi apstājas, aptverot tikai nelielu daļu no tās.
Nozares dati apstiprina, cik izplatīts ir šis modelis. OpenText Capgemini un Sogeti 2025. gada Pasaules kvalitātes ziņojumā tika konstatēts, ka 60 % aptaujāto organizāciju galvenais šķērslis mākslīgā intelekta ieviešanai bija bažas par uzticamību un kļūdām. Atsevišķs Gong pētījums atklāja, ka 58 % uzņēmumu bija apturējuši mākslīgā intelekta projektus un gandrīz pusi no plānotajiem ieguldījumiem mākslīgajā intelektā kavēja nevis budžeta ierobežojumi, bet gan uzticības problēmas. Rīki ir spējīgi. Uzticēšanās tiem ir tā, kas atpaliek.
Matemātika aiz vienas nepareizas atbildes
Atbalsta darbs ir asimetrisks tādā ziņā, ka tas sodītu vidējo precizitāti kā rādītāju. Pareiza atbilde ietaupa dažas minūtes. Nepareiza atbilde var apstiprināt atmaksu, kas nekad nebūtu bijusi jāveic, izdomāt politiku, kas nekad nav pastāvējusi, vai uzņemties saistības, kuras neviens nav atļāvis. Ja vienas kļūdas negatīvās sekas pārsniedz simts pareizu atbilžu pozitīvo ietekmi, optimizācija vidējā gadījumā ir pilnīgi nepareizs mērķis.
Ir arī mazāk pamanāmas izmaksas. Atbalsta vadītājs, kurš vienreiz pamanījis, ka AI kļūdās, pēc tam sāk visu pārbaudīt divreiz, kas izdzēš lielāko daļu laika, ko tas bija paredzēts ietaupīt. Uzticēšanās netiek vērtēta katrā sarunā atsevišķi. Tā vai nu veidojas, vai sabrūk, un, tiklīdz tā sabrūk, komandas pārstāj uzticēties sistēmai pat tad, ja tā lielākajā daļā gadījumu darbojas pareizi.
Halucinācijas neizzūd, tās tiek pārvaldītas
Pat vislabākie valodas modeļi pareizos apstākļos izdomā informāciju, un patiesie skaitļi ir augstāki, nekā lielākā daļa cilvēku pieņem. Attiecībā uz pamatotu kopsavilkumu veidošanu — būtībā to pašu uzdevumu, kas atbilžu sniegšana no saviem palīdzības dokumentiem — Vectara halucināciju reitinga tabulā labākie modeļi sasniedz apmēram 3 %, bet labi zināmie vadošie modeļi ir grupā no 6 % līdz 15 %. Daži modeļi, kas intensīvi izmanto loģisko secināšanu, šajā pašā uzdevumā pārsniedz 20 %, jo dziļāka loģiskā secināšana dod tiem lielākas iespējas izvirzīt apgalvojumus, ko avota teksts nekad nav izteicis. Ja modeli liek atbildēt uz atvērtā tipa jautājumiem, kuriem nav nekāda pamata, rādītāji kļūst daudz sliktāki. Stenfordas pētnieki atklāja, ka vadošie modeļi rada halucinācijas lielākajā daļā konkrētu juridisku jautājumu, ja netika sniegts avota dokuments.
Tas nenozīmē, ka kāds konkrēts modelis būtu slikts. Tas nozīmē, ka neviens atsevišķs modelis, ja to izmanto vienatnē, nav pietiekami uzticams, lai to izmantotu maksājošu klientu vajadzībām bez kādas uzraudzības.
Inteliģence un kontrole velk pretējās virzienos
Ir strukturāls iemesls, kāpēc viens pats modelis nevar atrisināt šo problēmu. Kad sistēma kļūst labāka neskaidru vai nepazīstamu gadījumu apstrādē, to kļūst arī grūtāk pilnībā prognozēt, jo tas pats loģiskais pamatojums, kas ļauj tai apstrādāt gadījumu, kuru neviens nav iepriekš paredzējis, ir tas pats pamatojums, kas reizēm noved to tur, kur tai nevajadzētu nonākt. Spējīgāks modelis ne vienmēr nozīmē drošāku modeli. Šis kompromiss ir iemesls, kāpēc uzticamība ir jāveido kā slānis ap modeli, nevis jāgaida no paša modeļa.
Aissist šo jautājumu risina, izmantojot četras slāņveida metodes, nevis vienu. Prompt inženierija nosaka pamatnoteikumus, kuriem seko katrs uzdevums, un tas ir īpaši svarīgi aģentu sistēmā, kur viena klienta pieprasījuma rezultātā var izveidoties vairāk nekā ducis apakšuzdevumu, kuriem visiem ir jāievēro vieni un tie paši ierobežojumi. „Booster” posms neapšaubāmus lēmumus izpilda vairākkārt un saglabā atbildi, par kuru vienojas lielākā daļa aģentu, pat ja tas prasa papildu aprēķinu resursus. Pašpārbaudes posms liek sistēmai pārskatīt savu izvadi vai nodot to otram modelim ar atšķirīgu lomu, pirms kaut kas nonāk pie klienta. Un virs visa tā atrodas saliktais pārvaldības slānis, kas pirms izvades nosūta pārbauda, vai izvade vai darbība atbilst politikai, darbojoties ne tik daudz kā filtrs, bet drīzāk kā visas sistēmas uzraugs.
Tieši šī kombinācija ļauj platformai uzturēt savas AI kļūdu likmi zem 1 % — šis skaitlis ir vērts pieminēt galvenokārt tādēļ, ka šajā jomā to vispār publicē ļoti maz piegādātāju.
Lēmuma pieņemšana par to, kad neatbildēt
Vērtīgākā atbalsta aģenta rīcība nav atbildēt pareizi uz vairāk jautājumiem. Tā ir spēja atpazīt, uz kuriem jautājumiem nevajadzētu mēģināt atbildēt vienam pašam. Sistēma, kas sarežģītu rēķinu strīdu savlaicīgi pārsūta augstākai instancē, pievienojot pilnu kontekstu, nodara daudz mazāku kaitējumu nekā tā, kas turpina rīkoties un mēģina uzminēt. Tas arī atšķir aģentu, kurš apraksta risinājumu, no tā, kurš to faktiski piemēro, atverot pasūtījumu, veicot izmaiņas un apstiprinot tās klientam.
Uzticamība ir jāuztur, nevis tikai jāizveido
Sistēma, kas ir precīza tās ieviešanas dienā, tāda nepaliks, ja to neviens nepārraudzīs. Produkti mainās, politikas tiek atjauninātas, un klientu jautājumi mainās līdzi tām. Nepārtraukta novērošana fiksē šīs izmaiņas kā datus, nevis kā sūdzību vilni, un disciplinēts novērtēšanas, testēšanas un ieviešanas cikls nepārtraukti novērš atklātās nepilnības, turklāt cilvēks joprojām apstiprina izmaiņas, pirms tās tiek reāli ieviestas.
Ko patiesībā pārbaudīt, pirms uzticēties piegādātājam
Jebkurš piegādātājs, kurš apgalvo, ka viņa mākslīgais intelekts nekad nekļūdās, ir jāuztver ar aizdomām, jo tas parasti nozīmē, ka neviens neveic pietiekami rūpīgus mērījumus, lai pārliecinātos par pretējo. Tie, kurus ir vērts uztvert nopietni, publicē kļūdu rādītājus, precīzi izskaidro, kā viņi atklāj kļūdas, pirms klienti tās pamanījuši, un atklāti informē par to, kad sistēma nodod lietu cilvēkam, nevis paļaujas uz minējumiem. Tas ir pavisam atšķirīgs piedāvājums no saukļa „uzticieties mākslīgajam intelektam”, un tieši šāds piedāvājums iztur pārbaudi, kad sistēma sasniedz reālu pieprasījumu apjomu.

