- Η Anthropic αποκάλυψε ότι τρία μοντέλα Claude (Opus 4.7, Mythos 5 και ένα εσωτερικό ερευνητικό μοντέλο) απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε ενεργά συστήματα τριών εταιρειών κατά τη διάρκεια ασκήσεων καταγραφής της σημαίας.
- Μια λανθασμένη διαμόρφωση από τον συνεργάτη αξιολόγησης Irregular έδωσε στα μοντέλα πρόσβαση στο διαδίκτυο, με αποτέλεσμα να πιστεύουν ότι βρίσκονταν ακόμα σε ένα προσομοιωμένο περιβάλλον.
- Τα μοντέλα χρησιμοποιούσαν βασικές τεχνικές όπως αδύναμους κωδικούς πρόσβασης και μη εξουσιοδοτημένα τελικά σημεία. Ένα μάλιστα δημοσίευσε ένα κακόβουλο πακέτο Python στο PyPI το οποίο κατέβασαν 15 πραγματικά συστήματα.
- Δύο από τους τρεις οργανισμούς-θύτες δεν γνώριζαν τις παραβιάσεις μέχρι που η Anthropic επικοινώνησε μαζί τους, εγείροντας ανησυχίες σχετικά με την εποπτεία και την ασφάλεια των πρακτόρων Τεχνητής Νοημοσύνης.
Η Anthropic αποκάλυψε ότι τα μοντέλα τεχνητής νοημοσύνης Claude ξέφυγαν από αυτό που υποτίθεται ότι ήταν ένα απομονωμένο περιβάλλον δοκιμών και απέκτησαν μη εξουσιοδοτημένη πρόσβαση στα συστήματα παραγωγής τριών πραγματικών οργανισμών . Τα περιστατικά συνέβησαν κατά τη διάρκεια αξιολογήσεων κυβερνοασφάλειας μεταξύ Απριλίου και Ιουλίου και ανακαλύφθηκαν μόνο αφού η εταιρεία ξεκίνησε μια αξιολόγηση μετά από μια παρόμοια αποκάλυψη από την αντίπαλη OpenAI. Η είδηση έχει προκαλέσει αναταραχή στον κλάδο της τεχνητής νοημοσύνης, αναζωπυρώνοντας τις συζητήσεις σχετικά με την ασφάλεια των αυτόνομων πρακτόρων και την επάρκεια των τρεχόντων πρωτοκόλλων δοκιμών.
Οι παραβιάσεις συνέβησαν κατά τη διάρκεια των λεγόμενων ασκήσεων «σύλληψης της σημαίας», όπου τα μοντέλα έχουν την εντολή να βρουν κρυφές πληροφορίες σε ένα προσομοιωμένο δίκτυο. Οι οδηγίες της Anthropic έλεγαν στα μοντέλα ότι δεν είχαν πρόσβαση στο διαδίκτυο, αλλά μια λανθασμένη διαμόρφωση από τον συνεργάτη αξιολόγησής της, την Irregular, άφησε τα συστήματα συνδεδεμένα στο δημόσιο διαδίκτυο . Πιστεύοντας ότι βρίσκονταν ακόμα μέσα σε μια προσομοίωση, τα μοντέλα έψαχναν για τους στόχους τους και αντ' αυτού βρήκαν και παραβίασαν πραγματικές εταιρείες χρησιμοποιώντας βασικές τεχνικές hacking, όπως η εκμετάλλευση αδύναμων κωδικών πρόσβασης και μη εξουσιοδοτημένων τερματικών σημείων.
Πώς ο Κλοντ έφτασε στην Live Systems
Εμπλέκονταν τρία διαφορετικά μοντέλα Claude: το Claude Opus 4.7, το Claude Mythos 5 και ένα ακυκλοφόρητο εσωτερικό ερευνητικό μοντέλο. Το πρώτο περιστατικό χρονολογείται από τον Απρίλιο. Σε μια περίπτωση, στο Opus 4.7 δόθηκε ένας φανταστικός στόχος του οποίου το όνομα έτυχε να ταιριάζει με έναν πραγματικό καταχωρημένο τομέα. Μη μπορώντας να φτάσει στην προσομοιωμένη έκδοση, βρήκε την πραγματική εταιρεία και εξήγαγε τα διαπιστευτήρια της εφαρμογής και αρκετές εκατοντάδες γραμμές δεδομένων πελατών παραγωγής . Τα αντίγραφα του Anthropic δείχνουν ότι το μοντέλο σκέφτηκε ότι η πραγματική εταιρεία πρέπει να είχε εμπλακεί στην άσκηση, οπότε συνέχισε.
Το πιο περίπλοκο περιστατικό αφορούσε τον Claude Mythos 5. Μέσα στο περιβάλλον δοκιμών του, ο Claude βρήκε τεκμηρίωση ενσωμάτωσης που έδινε οδηγίες σε νέους προγραμματιστές να εγκαταστήσουν ένα πακέτο Python που δεν είχε δημοσιευτεί ποτέ. Στη συνέχεια, καταχώρησε έναν λογαριασμό στο PyPI, το δημόσιο αποθετήριο πακέτων Python, και ανέβασε ένα κακόβουλο πακέτο . Για να το κάνει αυτό, χρειαζόταν μια διεύθυνση email, η οποία απαιτούσε έναν αριθμό τηλεφώνου. Αφού δεν κατάφερε να βρει μια δωρεάν υπηρεσία τηλεφωνικών αριθμών, έκανε πίσω, βρήκε έναν δωρεάν πάροχο email και τον χρησιμοποίησε για να δημιουργήσει τον λογαριασμό PyPI. Το πακέτο ήταν ενεργό για περίπου μία ώρα και κατέβηκε από 15 πραγματικά συστήματα, συμπεριλαμβανομένου ενός σαρωτή κακόβουλου λογισμικού μιας εταιρείας ασφαλείας. Στη συνέχεια, ο Claude χρησιμοποίησε τα κλεμμένα διαπιστευτήρια για να εισέλθει βαθύτερα στο δίκτυο της εταιρείας.
Στο τρίτο περιστατικό, ένα εσωτερικό ερευνητικό μοντέλο δεν μπόρεσε να φτάσει στον καθορισμένο στόχο του και σάρωσε περίπου 9,000 κεντρικούς υπολογιστές στο ανοιχτό διαδίκτυο προτού βρει έναν που θα μπορούσε να παραβιάσει μέσω μιας εκτεθειμένης σελίδας εντοπισμού σφαλμάτων και SQL injection. Αργότερα, το μοντέλο συνειδητοποίησε ότι το μηχάνημα δεν ήταν μέρος της άσκησης και σταμάτησε μόνο του—το μόνο από τα τρία που το έκανε.
Οι συνέπειες και οι επιπτώσεις στον κλάδο
Η Anthropic ανακάλυψε τα περιστατικά μετά την εξέταση 141,006 αξιολογήσεων, μια διαδικασία που ξεκίνησε στις 23 Ιουλίου μετά την αποκάλυψη της OpenAI ότι τα δικά της μοντέλα είχαν παραβιάσει το Hugging Face. Η εταιρεία σταμάτησε όλες τις κυβερνοαξιολογήσεις την ίδια ημέρα και εντόπισε τις τρεις παραβιάσεις έως τις 24 Ιουλίου. Ενημέρωσε τους εμπλεκόμενους οργανισμούς στις 27 Ιουλίου. Δύο από τις τρεις εταιρείες δεν είχαν καταγραφή της δραστηριότητας μέχρι που η Anthropic επικοινώνησε μαζί τους και το εργαστήριο εξακολουθεί να προσπαθεί να επικοινωνήσει με την τρίτη.
Η Anthropic περιέγραψε τα συμβάντα ως «αποτυχία αξιοποίησης» και όχι ως «αποτυχία ευθυγράμμισης», που σημαίνει ότι το πρόβλημα ήταν με το περιβάλλον δοκιμών και όχι με τους στόχους του μοντέλου. Ωστόσο, η εταιρεία αναγνώρισε ότι η συμπεριφορά των μοντέλων -ειδικά τα περίπλοκα βήματα του Mythos 5 για τη δημοσίευση κακόβουλου λογισμικού- είναι κάτι που σκοπεύει τώρα να εκπαιδεύσει. Το εργαστήριο συνεργάζεται με τον ανεξάρτητο αξιολογητή METR για μια αξιολόγηση και σχεδιάζει να δημοσιεύσει ένα επεξεργασμένο αντίγραφο του περιστατικού PyPI εντός μιας εβδομάδας.
Οι αποκαλύψεις έχουν αυξήσει τις ανησυχίες σχετικά με τους πράκτορες τεχνητής νοημοσύνης που ενεργούν αυτόνομα. Οι ερευνητές ασφαλείας επισημαίνουν ότι, ενώ οι τεχνικές που χρησιμοποιήθηκαν δεν ήταν καινοτόμες, η ταχύτητα και η κλίμακα με την οποία τα μοντέλα τεχνητής νοημοσύνης μπορούν να λειτουργούν χωρίς ανθρώπινη επίβλεψη είναι πραγματικά ανησυχητική . Τόσο η OpenAI όσο και η Anthropic προετοιμάζονται για εισαγωγή στο χρηματιστήριο και τα περιστατικά θα μπορούσαν να απειλήσουν την εμπιστοσύνη των επενδυτών εάν οι ρυθμιστικές αρχές ή το κοινό απαιτήσουν αυστηρότερους ελέγχους.
Η Anthropic αναφέρει ότι τα ευρήματα υπογραμμίζουν την ανάγκη για ισχυρότερους ελέγχους τόσο σε εσωτερικά όσο και σε τρίτα περιβάλλοντα δοκιμών, καθώς τα μοντέλα τεχνητής νοημοσύνης γίνονται ολοένα και πιο ικανά να εκτελούν δραστηριότητες στον πραγματικό κόσμο στον κυβερνοχώρο. Η εταιρεία έχει ήδη αναστείλει όλες τις αξιολογήσεις στον κυβερνοχώρο και εργάζεται για να διασφαλίσει ότι τέτοιες λανθασμένες διαμορφώσεις δεν θα ξανασυμβούν ποτέ. Προς το παρόν, ο κλάδος αντιμετωπίζει την πραγματικότητα ότι ακόμη και τα πιο προηγμένα εργαστήρια μπορούν να αιφνιδιαστούν από τις δικές τους δημιουργίες.