• Technologijos

Kodėl dirbtinio intelekto pagalba pilotams stringa dėl pasitikėjimo, o ne dėl galimybių

  • Felix Rose-Collins
  • 3 min read

Įvadas

Dauguma įmonių, bandančių taikyti dirbtinį intelektą klientų aptarnavimui, susiduria su ta pačia kliūtimi. Sistema keletą savaičių veikia puikiai. Tada vienam klientui ji pateikia užtikrintą, bet visiškai neteisingą atsakymą. Galbūt apie grąžinimo terminą. Galbūt apie praėjusį ketvirtį pasikeitusią politiką. Tai pastebi vienas iš vadovų, ir diegimas, kuris turėjo apimti didžiąją dalį klientų eilės, tyliai sustabdomas, neapėmęs net nedidelės jos dalies.

Šios srities duomenys patvirtina, kaip dažnai pasikartoja šis scenarijus. „OpenText Capgemini“ ir „Sogeti“ 2025 m. pasaulinėje kokybės ataskaitoje nustatyta, kad 60 % apklaustų organizacijų pagrindine kliūtimi diegti dirbtinį intelektą laikė patikimumo ir klaidingų atsakymų problemas. Atskiras „Gong“ tyrimas parodė, kad 58 % įmonių sustabdė dirbtinio intelekto projektus, o beveik pusę planuotų investicijų į dirbtinį intelektą stabdė ne biudžeto, o pasitikėjimo problemos. Įrankiai yra pajėgūs. Trūksta tik pasitikėjimo jais.

Vieno neteisingo atsakymo matematika

Pagalbos darbas yra asimetriškas tuo, kad vertinant pagal vidutinį tikslumą kaip rodiklį, jis tampa nepalankus. Teisingas atsakymas sutaupo keletą minučių. Neteisingas atsakymas gali patvirtinti grąžinimą, kurio niekada neturėjo būti, sugalvoti politiką, kurios niekada nebuvo, arba prisiimti įsipareigojimą, kurio niekas nepatvirtino. Kai vienos klaidos neigiamas poveikis nusveria šimto teisingų atsakymų teigiamą poveikį, optimizavimas pagal vidutinį atvejį yra visiškai neteisingas tikslas.

Yra ir mažiau pastebima kaina. Pagalbos skyriaus vadovas, kuris vieną kartą pastebi, kad AI klysta, po to pradeda viską tikrinti du kartus, o tai panaikina didžiąją dalį laiko, kurį turėjo sutaupyti. Pasitikėjimas nėra vertinamas pagal kiekvieną pokalbį. Jis auga arba žlunga, o kai žlunga, komandos nustoja pasitikėti sistema net tada, kai ji daugeliu atvejų yra teisi.

Haliucinacijos neišnyksta, jas reikia valdyti

Net ir galingiausi kalbos modeliai tam tikromis sąlygomis sukuria išgalvotus atsakymus, o tikrieji skaičiai yra didesni, nei dauguma žmonių mano. Kalbant apie pagrįstą santrauką – iš esmės tą pačią užduotį, kaip ir atsakymų pateikimą remiantis savo pačių pagalbos dokumentais – „Vectara“ halucinacijų reitingų lentelėje geriausi modeliai pasiekia apie 3 %, o gerai žinomi flagmaniniai modeliai susitelkia tarp 6 % ir 15 %. Kai kurie sudėtingą mąstymą reikalaujantys modeliai toje pačioje užduotyje viršija 20 %, nes gilesnis mąstymas suteikia jiems daugiau galimybių pateikti teiginius, kurių šaltinio tekste niekada nebuvo. Jei modelį priversite atsakyti į atvirus klausimus, neturint nieko, kuo jį pagrįsti, skaičiai tampa daug blogesni. Stanfordo universiteto tyrėjai nustatė, kad pirmaujantys modeliai „halucinuoja“ atsakydami į didžiąją dalį konkrečių teisinių klausimų, kai nebuvo pateiktas joks šaltinio dokumentas.

Tai nereiškia, kad kuris nors konkretus modelis yra blogas. Tai reiškia, kad nė vienas modelis, naudojamas atskirai, nėra pakankamai patikimas, kad jį būtų galima pateikti mokantiems klientams be kokios nors priežiūros.

Protingumas ir kontrolė traukia priešingomis kryptimis

Yra struktūrinė priežastis, kodėl vienas modelis negali to išspręsti savarankiškai. Kuo sistema geriau tvarkosi su dviprasmiškais ar nežinomais atvejais, tuo sunkiau ją visiškai nuspėti, nes tas pats mąstymas, leidžiantis jai tvarkytis su atveju, kurio niekas nebuvo numatęs, yra tas pats mąstymas, kuris kartais ją nuveda ten, kur ji neturėtų eiti. Galingesnis modelis nebūtinai yra saugesnis. Dėl šio kompromiso patikimumas turi būti suprojektuotas kaip sluoksnis aplink modelį, o ne tikimasi, kad modelis pats bus patikimas.

„Aissist“ šią problemą sprendžia naudodamas keturis sluoksnius, o ne vieną. „Prompt engineering“ nustato bazines taisykles, kurių laikosi kiekviena užduotis; tai ypač svarbu agentinėje sistemoje, kurioje vienas kliento prašymas gali išsiplėsti į daugiau nei tuziną užduočių, kurios visos turi laikytis tų pačių ribų. „Booster“ etapas neapibrėžtus sprendimus vykdo daugiau nei vieną kartą ir išlaiko atsakymą, dėl kurio sutinka dauguma agentų, nors tai ir reikalauja papildomų skaičiavimo išteklių. Savikontrolės etapas reiškia, kad sistema peržiūri savo pačios išvestį arba perduoda ją antrajam modeliui, atliekančiam kitą vaidmenį, prieš tai, kai kas nors pasiekia klientą. O virš viso to yra sukrautas valdymo sluoksnis, kuris prieš išsiuntimą patikrina, ar išvestis ar veiksmas atitinka politiką, veikdamas ne tiek kaip filtras, kiek kaip visos sistemos priežiūros institucija.

Būtent šis derinys leidžia platformai išlaikyti AI klaidų lygį žemiau 1 % – šis skaičius vertas dėmesio visų pirma todėl, kad šioje srityje labai nedaug tiekėjų jį apskritai skelbia.

Sprendimas, kada neatsakyti

Vertingiausias klientų aptarnavimo agento elgesys – ne tai, kad jis teisingai atsako į daugiau klausimų, o tai, kad sugeba atpažinti, į kuriuos klausimus neturėtų bandyti atsakyti savarankiškai. Sistema, kuri sudėtingą sąskaitų apmokėjimo ginčą perduoda aukštesniam lygmeniui anksti, pridėdama visą kontekstą, padaro kur kas mažiau žalos nei ta, kuri toliau bando spręsti problemą ir spėlioja. Būtent tai ir skiria agentą, kuris apibūdina sprendimą, nuo to, kuris jį iš tikrųjų įgyvendina – suranda užsakymą, atlieka pakeitimą ir patvirtina jį klientui.

Patikimumą reikia išlaikyti, o ne tik sukurti

Sistema, kuri veikimo pradžioje veikia tiksliai, tokia nebus, jei niekas jos neprižiūrės. Produktai keičiasi, politika atnaujinama, o klientų užduodami klausimai keičiasi kartu su jais. Nuolatinis vertinimas užfiksuoja šiuos pokyčius kaip duomenis, o ne kaip skundų bangą, o disciplinuotas vertinimo, testavimo ir diegimo ciklas nuolat užpildo rastas spragas, o žmogus vis dar patvirtina, prieš pradedant realius pakeitimus.

Ką iš tikrųjų reikia patikrinti prieš pasitikint tiekėju

Bet kuris tiekėjas, teigiantis, kad jo AI niekada neklysta, turėtų kelti įtarimų, nes tai paprastai reiškia, kad niekas neatlieka pakankamai atidžių matavimų, kad galėtų įsitikinti priešingai. Tie, kuriuos verta vertinti rimtai, skelbia klaidų dažnį, tiksliai paaiškina, kaip aptinka klaidas, kol jų nepastebi klientai, ir atvirai nurodo, kada sistema perduoda reikalą žmogui, o ne spėlioja. Tai visiškai kitoks pardavimo argumentas nei „pasitikėkite AI“, ir būtent jis pasiteisina, kai sistema susiduria su tikru užklausų srautu.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Pradėkite naudoti "Ranktracker"... nemokamai!

Sužinokite, kas trukdo jūsų svetainei užimti aukštesnes pozicijas.

Sukurti nemokamą paskyrą

Arba Prisijunkite naudodami savo įgaliojimus

Different views of Ranktracker app