Αυξάνονται τα περιστατικά όπου τα εργαλεία τεχνητής νοημοσύνης ΑΙ διαφεύγουν από τον έλεγχο των χρηστών τους για να πουν ψέματα, να αγνοήσουν οδηγίες και να επιδιώξουν στόχους με επιβλαβείς τρόπους. Έρευνα δείχνει επίσης ότι η σοβαρότητα της εξαπάτησης επιδεινώνεται.
Σύμφωνα με το Loss of Control Observatory, το οποίο παρακολουθεί τις αναφορές που υποβάλλονται από χρήστες τεχνητής νοημοσύνης στο X, τα πραγματικά περιστατικά απώλειας ελέγχου σε επιχειρήσεις και ιδιώτες σχεδόν διπλασιάστηκαν τον Ιούλιο σε σύγκριση με τον Ιούνιο, με περισσότερες από 300 περιπτώσεις τον μήνα.
Το παρατηρητήριο δημιουργήθηκε με χρηματοδότηση από το Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (AISI) της βρετανικής κυβέρνησης και άρχισε να παρακολουθεί τις περιπτώσεις μοντέλων τεχνητής νοημοσύνης που ξεφεύγουν από τις οδηγίες των χρηστών τους τον περασμένο Νοέμβριο.
Ανάμεσα στις περιπτώσεις που έχουν καταγραφεί από τότε είναι AI agents που προσποιούνται ότι είναι ο δικός τους χρήστης και μιμούνται το στυλ γραφής του για να δώσουν ουσιαστικά στον εαυτό τους τη συγκατάθεσή του προκειμένου να αναλάβουν ενέργειες και να παρακάμψουν κανόνες που απαιτούν ανθρώπινη έγκριση για ενέργειες, σημειώνει ο Guardian.
Η ανάλυση αυτών των περιστατικών αποκτά ακόμα μεγαλύτερη σημασία αφότου αποκαλύφθηκε ότι κορυφαία μοντέλα τεχνητής νοημοσύνης της OpenAI και της Anthropic διέφυγαν από τον έλεγχο των εταιρειών κατά τη διάρκεια δοκιμών αυτό το καλοκαίρι.
Αυτή την εβδομάδα αποκαλύφθηκε ότι το προσωπικό της Open AI παρατήρησε σημάδια αθέμιτης συμπεριφοράς μεταξύ των κορυφαίων AI agents της, εβδομάδες πριν αυτοί δραπετεύσουν από ένα περιβάλλον εκπαίδευσης (sandbox) για να ξεκινήσουν μια άνευ προηγουμένου εκστρατεία hacking που πυροδότησε παγκόσμιο συναγερμό. Οι AI agents της OpenAI χάκαραν την Hugging Face, με την σχετική έρευνα να αποκαλύπτει ότι περίπου 700 από αυτούς συνεργάζονταν κρυφά τον περασμένο μήνα και γιόρταζαν τις επιτυχίες τους στο hacking σε μία πλατφόρμα μηνυμάτων που δημιούργησαν για να τους βοηθήσει να οργανώσουν το σχέδιό τους, με επιφωνήματα όπως «ΜΠΟΥΜ!» και «Ουάου!».
Η AISI αποκάλυψε επίσης αυτόν τον μήνα ένα «σοβαρό περιστατικό» στο οποίο προηγμένα μοντέλα τεχνητής νοημοσύνης και από τις δύο εταιρείες -Mythos 5 της Anthropic και GPT-5.6 Sol της OpenAI- πραγματοποίησαν μια επίθεση hacking εναντίον πραγματικών ανθρώπων κατά τη διάρκεια μιας δοκιμής κυβερνοασφάλειας.
«Υπάρχει μερικές φορές η αντίληψη ότι αυτοί οι τύποι λανθασμένων και συγκαλυμμένων συμπεριφορών εμφανίζονται μόνο σε δοκιμές ή αξιολογήσεις, αλλά βλέπουμε παρόμοιες ανησυχητικές συμπεριφορές σε ευρύτερη χρήση. Δεν πρέπει να εφησυχάζουμε ότι αυτά τα πράγματα δεν θα συμβούν στον πραγματικό κόσμο και υπάρχουν ενδείξεις ότι ήδη συμβαίνουν», δήλωσε ο Tommy Shaffer-Shane, ανώτερος διευθυντής πολιτικής στο Centre for Long Term Resilience, το οποίο διαχειρίζεται το παρατηρητήριο.
Το AISI μετρά μόνο τα περιστατικά απώλειας ελέγχου που αναφέρονται από χρήστες στο X, επομένως είναι μόνο ένας μικρός αριθμός αυτών που πιθανότατα συμβαίνουν. Ωστόσο, ελλείψει άλλης ολοκληρωμένης έρευνας, παρέχει μια εικόνα του πώς συμπεριφέρονται μερικές φορές τα γρήγορα εξελισσόμενα μοντέλα τεχνητής νοημοσύνης.
Αυτόν τον μήνα αποκαλύφθηκε ότι ένας AI agent του OpenClaw, τον οποίο χρησιμοποιούσε ένα μέλος γυμναστηρίου στην Αυστραλία, συνωμότησε χωρίς ο χρήστης να το γνωρίζει για να αφαιρέσει ένα άλλο μέλος από μια λίστα αναμονής, ώστε ο χρήστης να μπορέσει να εξασφαλίσει μια θέση σε ένα περιζήτητο πρωινό μάθημα. Ο AI agent ζήτησε συγγνώμη, αλλά δεν μπόρεσε να επαναφέρει το μέλος που απέβαλε.

