Въведение
Повечето компании, които тестват изкуствен интелект за обслужване на клиенти, се сблъскват с една и съща пречка. Системата работи добре в продължение на седмици. После дава на един клиент уверен, но напълно грешен отговор. Може би относно срока за възстановяване на сумата. Може би относно политика, която се е променила през миналото тримесечие. Някой от висшето ръководство забелязва това и внедряването, което е трябвало да обхване по-голямата част от опашката, тихо се блокира, обхващайки само малка част от нея.
Данните от бранша потвърждават колко често се среща този модел. Докладът „2025 World Quality Report“ на OpenText, Capgemini и Sogeti установи, че притесненията относно надеждността и „халюцинациите“ са основна пречка за внедряването на изкуствен интелект за 60% от анкетираните организации. Отделно проучване на Gong установи, че 58% от компаниите са замразили проекти за изкуствен интелект, а почти половината от планираните инвестиции в изкуствен интелект са били възпрепятствани по-скоро от притеснения относно доверието, отколкото от бюджета. Инструментите са способни. Доверието в тях е това, което изостава.
Математиката зад един грешен отговор
Работата в поддръжката е асиметрична по начин, който наказва средната точност като показател. Един правилен отговор спестява няколко минут и. Един грешен отговор може да одобри възстановяване на сума, която никога не е трябвало да бъде изплатена, да измисли политика, която никога не е съществувала, или да поеме ангажимент, който никой не е одобрил. Когато негативният ефект от една грешка надвишава положителния ефект от сто правилни отговора, оптимизирането за средния случай е напълно погрешна цел.
Има и по-незабележима цена. Ръководител на екип за поддръжка, който забележи, че ИИ се е заблудил веднъж, започва да проверява всичко два пъти след това, което изтрива по-голямата част от времето, което би трябвало да спести. Доверието не се оценява за всеки разговор. То се натрупва или се руши, и веднъж щом се руши, екипите спират да вярват на системата, дори когато тя е права през по-голямата част от времето.
Халюцинациите не изчезват, а се управляват
Дори най-силните езикови модели измислят при подходящи условия, а реалните цифри са по-високи, отколкото повечето хора предполагат. При обосновано обобщаване – задача, която по същество е същата като отговарянето въз основа на собствените ви документи за помощ – класацията на Vectara за халюцинации поставя най-добрите модели около 3% и показва, че добре известните водещи модели се групират между 6% и 15%. Някои модели, изискващи интензивно разсъждение, надхвърлят 20% при същата задача, тъй като по-задълбоченото разсъждение им дава повече възможност да въвеждат твърдения, които изходният текст никога не е съдържал. Ако подложим модела на въпроси с отворен край, без нищо, на което да се основава, цифрите стават много по-лоши. Изследователи от Станфорд установиха, че водещите модели измислят отговори при голяма част от конкретните правни въпроси, когато не е предоставен изходен документ.
Нищо от това не означава, че някой конкретен модел е лош. Това означава, че нито един модел, използван самостоятелно, не е достатъчно надежден, за да бъде предложен на платежоспособни клиенти без нещо, което да го контролира.
Интелигентността и контролът се движат в противоположни посоки
Има структурна причина, поради която един-единствен модел не може да реши този проблем сам. Колкото по-добре една система се справя с двусмислени или непознати случаи, толкова по-трудно става да се предскаже напълно поведението ѝ, защото същото разсъждение, което ѝ позволява да се справи със случай, за който никой не е написал сценарий, е същото разсъждение, което понякога я води на места, където не би трябвало да отиде. По-способният модел не е автоматично и по-безопасен. Този компромис е причината надеждността да трябва да бъде проектирана като слой около модела, а не да се очаква от самия модел.
Aissist подхожда към това с четирислойни техники, вместо с една. Инженерингът на подсказките определя базовите правила, които всяка задача следва, което е по-важно в система с агенти, където едно-единствено заявка от клиент може да се разшири до повече от дузина подзадачи, които всички трябва да спазват едни и същи ограничения. Етапът „бустер“ изпълнява несигурните решения повече от веднъж и запазва отговора, по който повечето агенти са се съгласили, за сметка на допълнителна изчислителна мощност. Етапът на самопроверка кара системата да прегледа собствения си резултат или да го предаде на втори модел в различна роля, преди нещо да стигне до клиента. А над всичко това се намира многослоен управленски слой, който проверява дали даден резултат или действие съответства на политиката, преди да бъде изпратен, като функционира по-малко като филтър и повече като надзорник на цялата система.
Благодарение на тази комбинация платформата поддържа процента на грешките на изкуствения интелект под 1% – цифра, която заслужава да бъде отбелязана, главно защото толкова малко доставчици в тази сфера изобщо публикуват такава.
Преценка кога да не се отговаря
Най-ценното поведение при един оператор от отдела за поддръжка не е да отговаря правилно на повече въпроси. А да разпознава кои от тях не трябва да се опитва да отговори сам. Система, която ескалира сложен спор относно фактурирането на ранен етап, придружена с пълен контекст, нанася далеч по-малко щети, отколкото такава, която продължава напред и се опитва да гадае. Това е и това, което отличава оператора, който описва решението, от този, който действително го прилага – извлича поръчката, извършва промяната и я потвърждава пред клиента.
Надеждността трябва да се поддържа, а не само да се изгражда
Система, която е точна в деня на пускането ѝ, няма да остане такава, ако няма кой да я наблюдава. Продуктите се променят, политиките се актуализират, а въпросите, които задават клиентите, се променят заедно с тях. Непрекъс натото измерване улавя тази промяна като данни, а не като вълна от оплаквания, а дисциплинираният цикъл на оценяване, тестване и пускане на пазара продължава да запълва откритите пропуски, като човек все още дава одобрение, преди нещо да се промени наистина.
Какво всъщност да проверите, преди да се доверите на даден доставчик
Всеки доставчик, който твърди, че неговият ИИ никога не греши, трябва да бъде разглеждан с подозрение, защото това обикновено означава, че никой не измерва достатъчно внимателно, за да знае дали не е така. Тези, които си заслужават да бъдат взети на сериозно, публикуват процент на грешки, обясняват точно как улавят грешките, преди клиентите да ги забележат, и са откровени кога системата предава случая на човек, вместо да се опитва да отгатне. Това е съвсем различен подход от „доверете се на ИИ“ и именно той се оказва надежден, когато системата се сблъска с реален обем от заявки.

