• Technologie

Proč se zavádění umělé inteligence jako podpory pilotů zadrhává kvůli nedostatku důvěry, nikoli kvůli nedostatečným schopnostem

  • Felix Rose-Collins
  • 3 min read

Úvod

Většina firem, které testují umělou inteligenci v oblasti zákaznické podpory, naráží na stejnou překážku. Systém funguje několik týdnů bez problémů. Pak ale jednomu zákazníkovi poskytne sebevědomou a zcela nesprávnou odpověď. Třeba ohledně lhůty pro vrácení peněz. Třeba ohledně zásad, které se změnily v minulém čtvrtletí. Všimne si toho někdo z vedení a zavádění systému, které mělo pokrýt většinu fronty, se tiše zastaví na zlomku jejího objemu.

Údaje z oboru potvrzují, jak běžný je tento vzorec. Zpráva „2025 World Quality Report“ od společností OpenText, Capgemini a Sogeti zjistila, že obavy ohledně spolehlivosti a „halucinací“ byly pro 60 % dotazovaných organizací hlavní překážkou zavádění umělé inteligence. Samostatný výzkum společnosti Gong zjistil, že 58 % firem pozastavilo projekty v oblasti umělé inteligence a téměř polovina plánovaných investic do umělé inteligence byla zbrzděna spíše obavami o důvěryhodnost než rozpočtem. Nástroje jsou schopné. Zaostává však důvěra v ně.

Matematika za jednou špatnou odpovědí

Práce v oblasti podpory je asymetrická v tom smyslu, že jako metriku penalizuje průměrnou přesnost. Správná odpověď ušetří pár minut. Špatná odpověď může schválit vrácení peněz, které nikdy nemělo být provedeno, vymyslet zásadu, která nikdy neexistovala, nebo učinit závazek, který nikdo neschválil. Když nevýhoda jedné chyby převáží výhody stovky správných odpovědí, je optimalizace pro průměrný případ zcela nesprávným cílem.

Existují i skryté náklady. Vedoucí podpory, který jednou odhalí chybu AI, začne poté vše dvakrát kontrolovat, čímž se zmaří většina času, který měl systém ušetřit. Důvěra se nehodnotí podle jednotlivých konverzací. Buď se buduje, nebo se hroutí, a jakmile se zhroutí, týmy přestanou systému důvěřovat, i když má většinou pravdu.

Halucinace nezmizí, lze je však zvládnout

I ty nejvýkonnější jazykové modely si za správných podmínek vymýšlejí, a skutečná čísla jsou vyšší, než většina lidí předpokládá. U „grounded summarization“ (shrnutí založené na zdrojovém textu), což je v podstatě stejný úkol jako odpovídat na základě vlastních dokumentů nápovědy, uvádí žebříček halucinací společnosti Vectara, že nejlepší modely se pohybují kolem 3 % a známé vlajkové modely se shlukují mezi 6 % a 15 %. Některé modely s náročným uvažováním překračují u stejného úkolu 20 %, protože hlubší uvažování jim dává větší prostor k uvádění tvrzení, která zdrojový text nikdy neobsahoval. Pokud model vystavíte otevřeným otázkám, u nichž nemá žádné opěrné body, čísla se výrazně zhorší. Výzkumníci ze Stanfordu zjistili, že přední modely halucinují u velké většiny konkrétních právních otázek, pokud nebyl poskytnut žádný zdrojový dokument.

To vše neznamená, že by nějaký konkrétní model byl špatný. Znamená to, že žádný jednotlivý model, používaný samostatně, není dostatečně spolehlivý na to, aby byl nasazen pro platící zákazníky bez toho, aby ho někdo dohlížel.

Inteligence a kontrola táhnou opačnými směry

Existuje strukturální důvod, proč to jeden model sám o sobě nedokáže vyřešit. Jak se systém zlepšuje v řešení nejednoznačných nebo neznámých případů, stává se také těžší jej plně předvídat, protože stejné uvažování, které mu umožňuje vypořádat se s případem, pro který nikdo nenapsal scénář, je také tím uvažováním, které ho občas zavede někam, kam by neměl. Schopnější model nemusí automaticky znamenat bezpečnější model. Právě kvůli tomuto kompromisu je nutné spolehlivost navrhovat jako vrstvu obklopující model, místo aby se očekávala přímo od modelu samotného.

Aissist k tomu přistupuje pomocí čtyřvrstvých technik namísto jedné. Prompt engineering stanovuje základní pravidla, kterými se řídí každý úkol, což je důležitější v agentním systému, kde se jediný požadavek zákazníka může rozvinout do více než tuctu dílčích úkolů, které všechny musí dodržovat stejná ochranná opatření. Krok „booster“ provádí nejistá rozhodnutí vícekrát a zachovává odpověď, na které se shodne většina agentů, i za cenu dodatečného výpočetního výkonu. Krok „self inspection“ zajišťuje, že systém zkontroluje svůj vlastní výstup, nebo jej předá druhému modelu v jiné roli, než se cokoli dostane k zákazníkovi. A nad tím vším se nachází vrstva „stacked governance“, která před odesláním kontroluje, zda výstup nebo akce odpovídá zásadám, a funguje spíše jako dohlížitel celého systému než jako filtr.

Díky této kombinaci udržuje platforma míru chyb umělé inteligence pod 1 %, což je číslo, které stojí za zmínku hlavně proto, že jen velmi málo dodavatelů v této oblasti tuto hodnotu vůbec zveřejňuje.

Rozhodování, kdy neodpovídat

Nejcennějším chováním agenta podpory není správné zodpovězení většího počtu otázek. Je to rozpoznání, na které z nich by se neměl pokoušet odpovědět sám. Systém, který včas eskaluje složitý spor ohledně fakturace spolu s úplným kontextem, způsobí mnohem menší škody než ten, který pokračuje dál a hádá. To je také to, co odlišuje agenta, který popisuje řešení, od toho, který jej skutečně aplikuje – vyhledá objednávku, provede změnu a potvrdí ji zákazníkovi.

Spolehlivost je třeba udržovat, nestačí ji jen vybudovat

Systém, který je přesný v den spuštění, takový nezůstane, pokud ho nikdo nebude sledovat. Produkty se mění, zásady se aktualizují a otázky, které zákazníci kladou, se mění spolu s nimi. Průběžné měření zachycuje tyto změny jako data, nikoli jako vlnu stížností, a disciplinovaný cyklus hodnocení, testování a nasazení neustále uzavírá mezery, které najde, přičemž člověk stále schvaluje změny, než dojde k jejich skutečnému provedení.

Co skutečně zkontrolovat, než důvěřujete dodavateli

K jakémukoli dodavateli, který tvrdí, že jeho AI se nikdy nemýlí, je třeba přistupovat s podezřením, protože to obvykle znamená, že nikdo neprovádí dostatečně pečlivá měření, aby věděl, že tomu tak není. Ti, které stojí za to brát vážně, zveřejňují míru chybovosti, přesně vysvětlují, jak chyby zachycují dříve, než si jich zákazníci všimnou, a otevřeně informují o tom, kdy systém předá případ člověku, místo aby se spoléhal na odhady. To je zcela odlišný přístup než „důvěřujte AI“ a je to ten, který skutečně obstojí, jakmile na něj dolehne skutečný objem požadavků.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Začněte používat Ranktracker... zdarma!

Zjistěte, co brání vašemu webu v umístění.

Vytvoření bezplatného účtu

Nebo se přihlaste pomocí svých přihlašovacích údajů

Different views of Ranktracker app