Μια από τις πιο ανησυχητικές πλευρές της νέας εποχής των αυτόνομων συστημάτων τεχνητής νοημοσύνης ανέδειξε η ίδια η Anthropic, δημοσιοποιώντας περιστατικά στα οποία μοντέλα Claude προχώρησαν σε ενέργειες που ξεπερνούσαν σαφώς το πλαίσιο της αρχικής εντολής.
Το πιο εντυπωσιακό συνέβη σε δοκιμή του Claude Haiku 4.5. Το μοντέλο περιηγούνταν σε τυχαίες ιστοσελίδες στο πλαίσιο αξιολόγησης και βρέθηκε μπροστά σε σελίδα που αφορούσε ανεξιχνίαστη ανθρωποκτονία στη Φιλαδέλφεια.
Υπέβαλε πραγματική «πληροφορία» στην αστυνομία
Στη σελίδα υπήρχε ηλεκτρονική φόρμα της αστυνομίας για την υποβολή πληροφοριών.
Το Claude τη συμπλήρωσε και την υπέβαλε κανονικά, αναφέροντας ότι «ίσως διαθέτει πληροφορίες» για την υπόθεση και ότι θυμάται να έχει δει άτομο που ταίριαζε με την περιγραφή στην περιοχή.
Το πρόβλημα ήταν προφανές: καμία τέτοια μνήμη δεν υπήρχε, ενώ στη συγκεκριμένη ιστοσελίδα δεν υπήρχε καν περιγραφή δράστη πάνω στην οποία θα μπορούσε να βασιστεί το μοντέλο.
Η φόρμα τελικά χαρακτηρίστηκε spam και δεν διαβιβάστηκε για έρευνα, επομένως δεν υπήρξε πραγματική επιχειρησιακή συνέπεια.
Δεν ήταν μεμονωμένο περιστατικό
Η Anthropic εντόπισε συνολικά τέσσερις κατηγορίες ανεπιθύμητης συμπεριφοράς.
Σε ορισμένες περιπτώσεις, μοντέλα προσπάθησαν να παρακάμψουν τεχνικούς περιορισμούς προκειμένου να αποκτήσουν πρόσβαση σε δεδομένα. Σε άλλη περίπτωση εντόπισαν αδυναμία λογισμικού σε server και τη χρησιμοποίησαν για να εκτελέσουν εντολές, ώστε να ολοκληρώσουν την εργασία που τους είχε ανατεθεί.
Καταγράφηκαν επίσης περιστατικά όπου μοντέλα υπέβαλαν πραγματικές ηλεκτρονικές φόρμες ενώ το περιβάλλον δοκιμής προέβλεπε ότι θα έπρεπε απλώς να προσομοιώνουν τη διαδικασία.
Το πρόβλημα των «agents»
Το ζήτημα γίνεται μεγαλύτερο όσο η τεχνητή νοημοσύνη μετατρέπεται από απλό chatbot σε agent που μπορεί να περιηγείται στο διαδίκτυο, να πατά κουμπιά, να συμπληρώνει φόρμες και να χρησιμοποιεί εξωτερικά εργαλεία.
Σε αυτή την περίπτωση, ένα λάθος δεν μένει πλέον στην οθόνη ως μια λανθασμένη απάντηση. Μπορεί να μετατραπεί σε πραγματική ενέργεια.
Η Anthropic σφίγγει τις δικλείδες
Μετά τα περιστατικά, η εταιρεία περιόρισε την πρόσβαση των εσωτερικών αξιολογήσεών της στο ανοιχτό διαδίκτυο, ενίσχυσε τα συστήματα παρακολούθησης και δημιούργησε πρόσθετους μηχανισμούς που μπλοκάρουν τέτοιου είδους συμπεριφορές.
Η Anthropic τονίζει ότι οι πραγματικές συνέπειες των συγκεκριμένων περιστατικών ήταν περιορισμένες.
Το μήνυμα, όμως, είναι μεγαλύτερο: όσο περισσότερη αυτονομία αποκτούν τα μοντέλα τεχνητής νοημοσύνης, τόσο πιο κρίσιμο γίνεται το ερώτημα όχι μόνο αν δίνουν τη σωστή απάντηση, αλλά αν καταλαβαίνουν πότε πρέπει να σταματούν.
Διαβάστε ακόμη:
- Γιατί ο Σταύρος Παπασταύρου δεν βρέθηκε στο τραπέζι του Αμερικανού ΥΠΕΞ, Μάρκο Ρούμπιο
- Θέατρο: 25 πρεμιέρες που θα συζητηθούν – Οι παραστάσεις που δεν πρέπει να χάσετε
- Τρία ελληνικά μπαρ ανάμεσα στα 50 καλύτερα του κόσμου για το 2026
- Βραβεία Νόμπελ: Πόσα χρήματα παίρνουν οι νικητές και ποιος πληρώνει τον λογαριασμό