• Teknologi

Hvorfor piloter, der bruger AI-støtte, tøver på grund af tillid og ikke på grund af ydeevne

  • Felix Rose-Collins
  • 4 min read

Indledning

De fleste virksomheder, der tester AI til kundesupport, støder på den samme forhindring. Systemet fungerer fint i flere uger. Så giver det en kunde et selvsikkert og fuldstændig forkert svar. Måske om en refusionsfrist. Måske om en politik, der blev ændret i sidste kvartal. En ledende medarbejder bemærker det, og den udrulning, der skulle dække det meste af køen, går stille og roligt i stå, når den kun har dækket en brøkdel af den.

Branchedata bekræfter, hvor udbredt dette mønster er. 2025 World Quality Report fra OpenText, Capgemini og Sogeti viste, at bekymringer om pålidelighed og fejl var den største barriere for indførelsen af AI for 60 % af de adspurgte organisationer. En separat undersøgelse fra Gong viste, at 58 % af virksomhederne havde sat AI-projekter i bero, og at næsten halvdelen af de planlagte AI-investeringer blev bremset af tillidsproblemer snarere end af budgetmæssige årsager. Værktøjerne er i stand til det. Det er tilliden til dem, der halter bagefter.

Matematikken bag ét forkert svar

Supportarbejde er asymmetrisk på en måde, der straffer gennemsnitlig nøjagtighed som måleparameter. Et korrekt svar sparer et par minutter. Et forkert svar kan godkende en refusion, der aldrig burde være udbetalt, opfinde en politik, der aldrig har eksisteret, eller indgå en forpligtelse, som ingen har godkendt. Når ulempen ved én fejl opvejer fordelen ved hundrede korrekte svar, er optimering med henblik på det gennemsnitlige tilfælde et helt forkert mål.

Der er også en mere skjult omkostning. En supportmedarbejder, der opdager, at AI’en tager fejl én gang, begynder derefter at dobbelttjekke alt, hvilket udhuler det meste af den tid, systemet egentlig skulle have sparet. Tillid måles ikke pr. samtale. Den opbygges eller bryder sammen, og når den først er brudt sammen, holder teamene op med at stole på systemet, selv når det har ret det meste af tiden.

Hallucinationer forsvinder ikke – de håndteres

Selv de stærkeste sprogmodeller finder på ting under de rette betingelser, og de reelle tal er højere, end de fleste antager. Når det gælder grundet sammenfatning – i det væsentlige den samme opgave som at svare ud fra egne hjælpedokumenter – placerer Vectaras rangliste over hallucinationer de bedste modeller omkring 3 % og viser, at velkendte flagskibsmodeller ligger mellem 6 % og 15 %. Nogle modeller, der er tunge på ræsonnement, stiger til over 20 % på den samme opgave, fordi dybere ræsonnement giver dem mere spillerum til at fremsætte påstande, som kildeteksten aldrig har fremsat. Sæt en model til at besvare åbne spørgsmål uden noget at basere sig på, og tallene bliver meget værre. Forskere fra Stanford fandt, at førende modeller hallucinerede på et stort flertal af specifikke juridiske spørgsmål, når der ikke blev leveret noget kildedokument.

Intet af dette betyder, at en bestemt model er dårlig. Det betyder, at ingen enkelt model, når den bruges alene, er pålidelig nok til at blive sat til at betjene betalende kunder uden, at der er noget, der holder øje med den.

Intelligens og kontrol trækker i modsatte retninger

Der er en strukturel årsag til, at en enkelt model ikke kan løse dette på egen hånd. I takt med at et system bliver bedre til at håndtere tvetydige eller ukendte sager, bliver det også sværere at forudsige fuldt ud, fordi den samme ræsonnement, der lader det håndtere en sag, som ingen har skrevet et manuskript til, er den samme ræsonnement, der lejlighedsvis fører det et sted hen, hvor det ikke burde være. En mere kapabel model er ikke automatisk en mere sikker model. Denne afvejning er grunden til, at pålidelighed skal konstrueres som et lag omkring modellen i stedet for at forventes af modellen i sig selv.

Aissist tackler dette med fire lagdelte teknikker i stedet for én. Prompt engineering fastlægger de grundlæggende regler, som hver opgave følger, hvilket er endnu vigtigere i et agentbaseret system, hvor en enkelt kundeanmodning kan udvides til mere end et dusin delopgaver, som alle skal overholde de samme retningslinjer. Et booster-trin kører usikre beslutninger mere end én gang og beholder det svar, som flest agenter er enige om, på bekostning af ekstra regnekraft. En selvinspektionsrunde får systemet til at gennemgå sin egen output eller videregive den til en anden model i en anden rolle, før noget når ud til kunden. Og et overordnet styringslag ligger oven over det hele og kontrollerer, om en output eller handling overholder retningslinjerne, før den sendes ud – det fungerer mindre som et filter og mere som en tilsynsførende for hele systemet.

Det er denne kombination, der gør, at platformen holder sin AI-fejlrate under 1 % – et tal, der er værd at bemærke, primært fordi så få udbydere i denne branche overhovedet offentliggør et sådant.

At vurdere, hvornår man ikke skal svare

Den mest værdifulde adfærd hos en supportmedarbejder er ikke at besvare flere spørgsmål korrekt. Det er at erkende, hvilke spørgsmål vedkommende ikke bør forsøge at besvare alene. Et system, der tidligt eskalerer en vanskelig faktureringsstrid med fuld kontekst vedlagt, forårsager langt mindre skade end et system, der presser på og gætter. Det er også det, der adskiller en medarbejder, der beskriver en løsning, fra en, der rent faktisk implementerer den – ved at hente ordren frem, foretage ændringen og bekræfte den over for kunden.

Pålidelighed skal opretholdes, ikke bare opbygges

Et system, der er præcist på lanceringsdagen, forbliver ikke sådan uden, at nogen holder øje med det. Produkter ændrer sig, politikker opdateres, og de spørgsmål, kunderne stiller, ændrer sig i takt hermed. Kontinuerlig måling opfanger disse ændringer som data i stedet for som en bølge af klager, og en disciplineret cyklus med evaluering, test og udrulning lukker løbende de huller, den finder, hvor et menneske stadig godkender, før noget ændres i praksis.

Hvad man rent faktisk skal tjekke, før man stoler på en leverandør

Enhver leverandør, der hævder, at deres AI aldrig tager fejl, bør behandles med mistro, for det betyder som regel, at ingen måler nøje nok til at vide, om det er sandt. De leverandører, der er værd at tage alvorligt, offentliggør en fejlprocent, forklarer præcist, hvordan de opfanger fejl, før kunderne ser dem, og er åbne om, hvornår systemet overdrager til en person i stedet for at gætte. Det er en helt anden salgstale end »stol på AI'en«, og det er den, der rent faktisk holder, når den reelle mængde henvendelser rammer systemet.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Begynd at bruge Ranktracker... Gratis!

Find ud af, hvad der forhindrer dit websted i at blive placeret på ranglisten.

Opret en gratis konto

Eller logge ind med dine legitimationsoplysninger

Different views of Ranktracker app