Johdanto
Useimmat yritykset, jotka testaavat tekoälyä asiakaspalvelussa, törmäävät samaan esteeseen. Järjestelmä toimii hyvin viikkojen ajan. Sitten se antaa yhdelle asiakkaalle varmalla äänellä täysin väärän vastauksen. Ehkä se koskee hyvitysaikaa. Ehkä se koskee viime neljänneksellä muuttunutta käytäntöä. Joku johtotason henkilö huomaa asian, ja käyttöönotto, jonka oli tarkoitus kattaa suurin osa jonosta, pysähtyy hiljaa vain murto-osaan siitä.
Alan tiedot vahvistavat, kuinka yleinen tämä malli on. OpenTextin, Capgeminin ja Sogetin vuoden 2025 World Quality Report -raportissa todettiin, että luotettavuus- ja virheellisyyshuolet olivat suurin este tekoälyn käyttöönotolle 60 prosentissa tutkituista organisaatioista. Gongin erillisessä tutkimuksessa havaittiin, että 58 prosenttia yrityksistä oli keskeyttänyt tekoälyhankkeita ja että lähes puolet suunnitelluista tekoälyinvestoinneista oli jäänyt toteuttamatta luottamuspulojen eikä budjetin vuoksi. Työkalut ovat kykeneviä. Luottamus niihin on se, mikä jää jälkeen.
Yhden väärän vastauksen takana oleva matematiikka
Tukityö on epäsymmetristä siten, että se rankaisee keskimääräistä tarkkuutta mittarina. Oikea vastaus säästää muutaman minuutin. Väärä vastaus voi hyväksyä hyvityksen, jota ei olisi koskaan pitänyt maksaa, keksiä käytäntöä, jota ei ole olemassa, tai tehdä sitoumuksen, jota kukaan ei ole valtuuttanut. Kun yhden virheen haitat ylittävät sadan oikean vastauksen hyödyt, keskimääräisen tapauksen optimointi on täysin väärä tavoite.
On myös hiljaisempi hinta. Tukipäällikkö, joka huomaa tekoälyn erehtyvän kerran, alkaa sen jälkeen tarkistaa kaiken kahdesti, mikä vie suurimman osan ajasta, jonka sen piti säästää. Luottamusta ei mitata keskustelukohtaisesti. Se kasvaa tai romahtaa, ja kun se romahtaa, tiimit lakkaavat luottamasta järjestelmään, vaikka se olisi oikeassa suurimman osan ajasta.
Hallusinaatiot eivät katoa, niitä hallitaan
Jopa vahvimmat kielimallit keksivät asioita oikeissa olosuhteissa, ja todelliset luvut ovat korkeammat kuin useimmat ihmiset olettavat. Perustellussa tiivistämisessä, joka on olennaisesti sama tehtävä kuin vastaaminen omista ohjeista, Vectaran harhojen tulostaulukossa parhaat mallit sijoittuvat noin 3 prosentin tasolle ja tunnetut lippulaivamallit keskittyvät 6–15 prosentin välille. Jotkut päättelypainotteiset mallit nousevat samassa tehtävässä yli 20 %:n, koska syvällisempi päättely antaa niille enemmän tilaa esittää väitteitä, joita lähdetekstissä ei ole koskaan esitetty. Jos malli joutuu vastaamaan avoimiin kysymyksiin, joihin ei ole mitään perustetta, luvut huononevat huomattavasti. Stanfordin tutkijat havaitsivat, että johtavat mallit tuottivat harhoja suurimmassa osassa erityisiä oikeudellisia kysymyksiä, kun lähdeasiakirjaa ei annettu.
Mikään tästä ei tarkoita, että mikään tietty malli olisi huono. Se tarkoittaa, ettei yksikään malli, yksinään käytettynä, ole riittävän luotettava, jotta sitä voitaisiin tarjota maksaville asiakkaille ilman, että joku valvoo sitä.
Älykkyys ja valvonta vetävät vastakkaisiin suuntiin
On rakenteellinen syy siihen, miksi yksittäinen malli ei pysty ratkaisemaan tätä ongelmaa yksinään. Kun järjestelmä parantaa kykyään käsitellä epäselviä tai tuntemattomia tapauksia, sitä on myös yhä vaikeampi ennustaa täysin, sillä sama päättely, jonka ansiosta se pystyy käsittelemään tapausta, jota kukaan ei ole ennalta määrittänyt, on myös se päättely, joka toisinaan johtaa sen jonnekin, minne sen ei pitäisi mennä. Kyvykkäämpi malli ei ole automaattisesti turvallisempi. Juuri tämän kompromissin vuoksi luotettavuus on suunniteltava mallia ympäröiväksi kerrokseksi sen sijaan, että sitä odotettaisiin mallilta itseltään.
Aissist lähestyy tätä neljällä kerroksellisella tekniikalla yhden sijaan. Prompt-suunnittelu asettaa perussäännöt, joita jokainen tehtävä noudattaa, mikä on tärkeämpää agenttijärjestelmässä, jossa yksittäinen asiakaspyyntö voi laajentua yli tusinaan alatehtävään, joiden kaikkien on noudatettava samoja suojakaiteita. Booster-vaihe suorittaa epävarmat päätökset useammin kuin kerran ja säilyttää vastauksen, josta suurin osa agenteista on samaa mieltä, vaikka se vaatii ylimääräistä laskentatehoa. Itsetarkastusvaiheessa järjestelmä tarkistaa oman tuotoksensa tai välittää sen toiselle mallille, jolla on erilainen rooli, ennen kuin mikään päätyy asiakkaalle. Ja kaiken tämän yläpuolella on monikerroksinen hallintakerros, joka tarkistaa, vastaako tuotos tai toiminta käytäntöjä ennen sen lähettämistä, toimien vähemmän suodattimena ja enemmän koko järjestelmän valvojana.
Tämän yhdistelmän ansiosta alusta pitää tekoälyn virheprosentin alle 1 prosentissa – luku, joka on huomionarvoinen lähinnä siksi, että niin harvat alan toimittajat julkaisevat sitä lainkaan.
Päätös siitä, milloin ei kannata vastata
Tukihenkilön arvokkain ominaisuus ei ole se, että hän vastaa useimpiin kysymyksiin oikein. Se on sen tunnistaminen, mihin kysymyksiin hänen ei pitäisi yrittää vastata yksin. Järjestelmä, joka eskaloidaa hankalan laskutusriidan varhaisessa vaiheessa ja liittää mukaan koko asiayhteyden, aiheuttaa huomattavasti vähemmän vahinkoa kuin järjestelmä, joka jatkaa eteenpäin ja arvaa vastauksen. Tämä erottaa myös asiakaspalvelijan, joka vain kuvailee korjauskeinoa, siitä, joka todella toteuttaa sen: hakee tilauksen esiin, tekee muutoksen ja vahvistaa sen asiakkaalle.
Luotettavuus on ylläpidettävä, ei vain rakennettava
Järjestelmä, joka on tarkka käyttöönottopäivänä, ei pysy sellaisena ilman valvontaa. Tuotteet muuttuvat, käytännöt päivitetään, ja asiakkaiden esittämät kysymykset muuttuvat niiden mukana. Jatkuva mittaaminen havaitsee nämä muutokset datana eikä valitusten aallona, ja kurinalainen arviointi-, testaus- ja julkaisusykli korjaa löydetyt puutteet, ja ihminen hyväksyy muutokset ennen kuin ne astuvat voimaan.
Mitä todella kannattaa tarkistaa ennen toimittajan luottamista
Mihin tahansa toimittajaan, joka väittää, ettei sen tekoäly koskaan erehdy, tulisi suhtautua epäilevästi, sillä se tarkoittaa yleensä, ettei kukaan mittaa tilannetta riittävän tarkasti todetakseen toisin. Ne toimittajat, joita kannattaa ottaa vakavasti, julkaisevat virheprosentin, selittävät tarkasti, miten ne havaitsevat virheet ennen kuin asiakkaat huomaavat niitä, ja kertovat avoimesti, milloin järjestelmä siirtää asian ihmisen käsiteltäväksi arvailun sijaan. Se on aivan erilainen myyntipuhe kuin ”luota tekoälyyn”, ja se on se, joka todella kestää, kun todellinen tikettimäärä iskee järjestelmään.

