Εισαγωγή
Οι περισσότερες εταιρείες που δοκιμάζουν την τεχνητή νοημοσύνη (AI) για την εξυπηρέτηση πελατών αντιμετωπίζουν το ίδιο εμπόδιο. Το σύστημα λειτουργεί κανονικά για εβδομάδες. Στη συνέχεια, δίνει σε έναν πελάτη μια σίγουρη αλλά εντελώς λανθασμένη απάντηση. Ίσως σχετικά με το χρονικό περιθώριο επιστροφής χρημάτων. Ίσως σχετικά με μια πολιτική που άλλαξε το προηγούμενο τρίμηνο. Κάποιος ανώτερος υπάλληλος το παρατηρεί και η εφαρμογή, που προοριζόταν να καλύψει το μεγαλύτερο μέρος της ουράς αναμονής, σταματά αθόρυβα, καλύπτοντας μόνο ένα μικρό μέρος της.
Τα στοιχεία του κλάδου επιβεβαιώνουν πόσο συνηθισμένο είναι αυτό το φαινόμενο. Η έκθεση «2025 World Quality Report» των OpenText, Capgemini και Sogeti διαπίστωσε ότι οι ανησυχίες σχετικά με την αξιοπιστία και τις «παραληρητικές» απαντήσεις αποτελούσαν το κύριο εμπόδιο στην υιοθέτηση της τεχνητής νοημοσύνης για το 60% των οργανισμών που συμμετείχαν στην έρευνα. Ξεχωριστή έρευνα της Gong διαπίστωσε ότι το 58% των εταιρειών είχε αναστείλει έργα τεχνητής νοημοσύνης και ότι σχεδόν το ήμισυ των προγραμματισμένων επενδύσεων σε τεχνητή νοημοσύνη αναβλήθηκε λόγω ανησυχιών σχετικά με την εμπιστοσύνη και όχι λόγω προϋπολογισμού. Τα εργαλεία είναι ικανά. Η εμπιστοσύνη σε αυτά είναι αυτή που υστερεί.
Η μαθηματική λογική πίσω από μια λανθασμένη απάντηση
Η εργασία υποστήριξης είναι ασύμμετρη, με τρόπο που τιμωρεί τη μέση ακρίβεια ως μέτρο αξιολόγησης. Μια σωστή απάντηση εξοικονομεί λίγα λεπτά. Μια λανθασμένη μπορεί να εγκρίνει μια επιστροφή χρημάτων που δεν έπρεπε ποτέ να γίνει, να επινοήσει μια πολιτική που δεν υπήρχε ποτέ ή να αναλάβει μια δέσμευση που κανείς δεν εξουσιοδότησε. Όταν το μειονέκτημα ενός λάθους υπερτερεί του πλεονεκτήματος εκατόν σωστών απαντήσεων, η βελτιστοποίηση για τη μέση περίπτωση είναι εντελώς λανθασμένος στόχος.
Υπάρχει και ένα πιο αθόρυβο κόστος. Ένας υπεύθυνος υποστήριξης που εντοπίζει ότι η τεχνητή νοημοσύνη έκανε λάθος μία φορά αρχίζει να διπλοελέγχει τα πάντα μετά από αυτό, κάτι που εξαλείφει το μεγαλύτερο μέρος του χρόνου που υποτίθεται ότι θα εξοικονομούσε. Η εμπιστοσύνη δεν βαθμολογείται ανά συνομιλία. Είτε χτίζεται είτε καταρρέει, και μόλις καταρρεύσει, οι ομάδες σταματούν να εμπιστεύονται το σύστημα ακόμα και όταν αυτό έχει δίκιο τις περισσότερες φορές.
Οι ψευδαισθήσεις δεν εξαφανίζονται, αλλά μπορούν να αντιμετωπιστούν
Ακόμη και τα ισχυρότερα γλωσσικά μοντέλα επινοούν πληροφορίες υπό τις κατάλληλες συνθήκες, και τα πραγματικά ποσοστά είναι υψηλότερα από ό,τι υποθέτουν οι περισσότεροι. Όσον αφορά τη «grounded summarization» (σύνοψη βασισμένη σε πηγές), που ουσιαστικά είναι η ίδια εργασία με την απάντηση από τα δικά σας έγγραφα βοήθειας, ο πίνακας κατάταξης της Vectara για τις «ψευδαισθήσεις» τοποθετεί τα καλύτερα μοντέλα γύρω στο 3% και δείχνει γνωστά κορυφαία μοντέλα να συγκεντρώνονται μεταξύ 6% και 15%. Ορισμένα μοντέλα που βασίζονται σε εντατική συλλογιστική ξεπερνούν το 20% στην ίδια εργασία, επειδή η βαθύτερη συλλογιστική τους δίνει περισσότερο περιθώριο να εισάγουν ισχυρισμούς που το κείμενο πηγής δεν έκανε ποτέ. Αν υποβάλετε ένα μοντέλο σε ερωτήσεις ανοιχτού τύπου χωρίς κανένα σημείο αναφοράς, τα ποσοστά επιδεινώνονται σημαντικά. Ερευνητές του Στάνφορντ διαπίστωσαν ότι κορυφαία μοντέλα παρουσίαζαν παραισθήσεις στη μεγάλη πλειοψηφία συγκεκριμένων νομικών ερωτήσεων, όταν δεν παρέχονταν έγγραφα πηγής.
Τίποτα από όλα αυτά δεν σημαίνει ότι κάποιο συγκεκριμένο μοντέλο είναι κακό. Σημαίνει ότι κανένα μοντέλο, όταν χρησιμοποιείται μόνο του, δεν είναι αρκετά αξιόπιστο για να το χρησιμοποιήσουν πελάτες που πληρώνουν, χωρίς να υπάρχει κάτι που να το εποπτεύει.
Η νοημοσύνη και ο έλεγχος τραβούν σε αντίθετες κατευθύνσεις
Υπάρχει ένας δομικός λόγος για τον οποίο ένα μεμονωμένο μοντέλο δεν μπορεί να λύσει αυτό το πρόβλημα από μόνο του. Καθώς ένα σύστημα βελτιώνεται στη διαχείριση ασαφών ή άγνωστων περιπτώσεων, γίνεται επίσης πιο δύσκολο να προβλεφθεί πλήρως, επειδή η ίδια λογική που του επιτρέπει να χειριστεί μια περίπτωση για την οποία κανείς δεν έχει γράψει σενάριο είναι η λογική που περιστασιακά το οδηγεί κάπου που δεν θα έπρεπε να πάει. Ένα πιο ικανό μοντέλο δεν είναι αυτομάτως και πιο ασφαλές. Αυτή η αντιστάθμιση είναι ο λόγος για τον οποίο η αξιοπιστία πρέπει να σχεδιαστεί ως ένα επίπεδο γύρω από το μοντέλο και όχι να αναμένεται από το ίδιο το μοντέλο.
Το Aissist προσεγγίζει αυτό το ζήτημα με τέσσερις τεχνικές σε επίπεδα αντί για μία. Η μηχανική προτροπών (prompt engineering) καθορίζει τους βασικούς κανόνες που ακολουθεί κάθε εργασία, κάτι που έχει μεγαλύτερη σημασία σε ένα σύστημα με πράκτορες, όπου ένα μεμονωμένο αίτημα πελάτη μπορεί να επεκταθεί σε περισσότερες από δώδεκα υπο-εργασίες, οι οποίες όλες πρέπει να τηρούν τα ίδια όρια ασφαλείας. Ένα στάδιο ενίσχυσης (booster) εκτελεί τις αβέβαιες αποφάσεις περισσότερες από μία φορές και διατηρεί την απάντηση στην οποία συμφωνούν οι περισσότεροι πράκτορες, με κόστος επιπλέον υπολογιστικής ισχύος. Ένας κύκλος αυτοελέγχου (self inspection) κάνει το σύστημα να επανεξετάζει τη δική του έξοδο ή να την παραδίδει σε ένα δεύτερο μοντέλο με διαφορετικό ρόλο, πριν οτιδήποτε φτάσει στον πελάτη. Και ένα πολυεπίπεδο στρώμα διακυβέρνησης βρίσκεται πάνω από όλα αυτά, ελέγχοντας αν μια έξοδος ή μια ενέργεια συμμορφώνεται με την πολιτική πριν εκδοθεί, λειτουργώντας λιγότερο ως φίλτρο και περισσότερο ως επόπτης για ολόκληρο το σύστημα.
Αυτός ο συνδυασμός είναι ο τρόπος με τον οποίο η πλατφόρμα διατηρεί το ποσοστό σφαλμάτων της τεχνητής νοημοσύνης κάτω από το 1%, ένας αριθμός που αξίζει να σημειωθεί κυρίως επειδή ελάχιστοι προμηθευτές σε αυτόν τον τομέα δημοσιεύουν καθόλου τέτοια στοιχεία.
Κρίση για το πότε να μην απαντήσει
Η πιο πολύτιμη συμπεριφορά ενός υπαλλήλου υποστήριξης δεν είναι να απαντά σωστά σε περισσότερες ερωτήσεις. Είναι να αναγνωρίζει ποιες ερωτήσεις δεν πρέπει να προσπαθήσει να απαντήσει μόνος του. Ένα σύστημα που αναβαθμίζει έγκαιρα μια περίπλοκη διαφορά χρέωσης, συνοδευόμενη από το πλήρες πλαίσιο, προκαλεί πολύ λιγότερη ζημιά από ένα σύστημα που προχωράει και κάνει εικασίες. Αυτό είναι επίσης που διακρίνει έναν υπάλληλο που περιγράφει μια λύση από έναν που την εφαρμόζει πραγματικά, ανακτώντας την παραγγελία, πραγματοποιώντας την αλλαγή και επιβεβαιώνοντάς την στον πελάτη.
Η αξιοπιστία πρέπει να διατηρείται, όχι μόνο να δημιουργείται
Ένα σύστημα που είναι ακριβές την ημέρα της κυκλοφορίας του δεν θα παραμείνει έτσι χωρίς κάποιον να το παρακολουθεί. Τα προϊόντα αλλάζουν, οι π ολιτικές ενημερώνονται και οι ερωτήσεις που θέτουν οι πελάτες μεταβάλλονται μαζί τους. Η συνεχής μέτρηση εντοπίζει αυτή τη μεταβολή ως δεδομένα και όχι ως κύμα παραπόνων, ενώ ένας πειθαρχημένος κύκλος αξιολόγησης, δοκιμών και κυκλοφορίας συνεχίζει να καλύπτει τα κενά που εντοπίζει, με έναν άνθρωπο να δίνει πάντα την τελική έγκριση πριν οποιαδήποτε αλλαγή τεθεί πραγματικά σε εφαρμογή.
Τι πρέπει πραγματικά να ελέγξετε πριν εμπιστευτείτε έναν προμηθευτή
Οποιοσδήποτε προμηθευτής ισχυρίζεται ότι η τεχνητή νοημοσύνη του δεν κάνει ποτέ λάθη πρέπει να αντιμετωπίζεται με καχυποψία, επειδή αυτό συνήθως σημαίνει ότι κανείς δεν μετράει αρκετά προσεκτικά για να γνωρίζει το αντίθετο. Αυτοί που αξίζει να ληφθούν σοβαρά υπόψη δημοσιεύουν ένα ποσοστό σφαλμάτων, εξηγούν ακριβώς πώς εντοπίζουν τα λάθη πριν τα δουν οι πελάτες και είναι ειλικρινείς σχετικά με το πότε το σύστημα παραδίδει την υπόθεση σε άνθρωπο αντί να κάνει εικασίες. Αυτή είναι μια πολύ διαφορετική προσέγγιση από το «εμπιστευθείτε την τεχνητή νοημοσύνη», και είναι αυτή που πραγματικά αντέχει όταν το σύστημα αντιμετωπίσει τον πραγματικό όγκο αιτημάτων.

