Η Anthropic ανακοίνωσε ότι τα μοντέλα τεχνητής νοημοσύνης της χάκαραν τρεις άλλους οργανισμούς κατά τη διάρκεια δοκιμών, λίγες μόνο ημέρες αφότου η OpenAI, δημιουργός του ChatGPT, εξέφρασε ανησυχίες σχετικά με τους ελέγχους της τεχνητής νοημοσύνης, αφού αποκάλυψε ότι τα «αυτοδύναμα» μοντέλα της εισέβαλαν σε άλλη εταιρεία.
Η Anthropic, η εταιρεία τεχνητής νοημοσύνης με έδρα το Σαν Φρανσίσκο που βρίσκεται πίσω από το Claude, δημοσίευσε στον ιστότοπό της την Πέμπτη ότι ανακάλυψε τα τρία περιστατικά μετά από την εξέταση περισσότερων από 141.000 δοκιμαστικών εκτελέσεων.
Η εταιρεία είχε ξεκινήσει μια «μεγάλης κλίμακας» αξιολόγηση της κυβερνοασφάλειας, η οποία αναζητούσε συγκεκριμένα στοιχεία για το αν τα μοντέλα τεχνητής νοημοσύνης της ήταν σε θέση να έχουν πρόσβαση στο διαδίκτυο από περιβάλλοντα δοκιμών που θα έπρεπε να ήταν απομονωμένα, ως απάντηση στο περιστατικό της OpenAI, ανέφερε η Anthropic.
Η Anthropic ανέφερε ότι τα μοντέλα που εμπλέκονταν στα περιστατικά ήταν τα Claude Opus 4.7, Claude Mythos 5 και ένα εσωτερικό ερευνητικό μοντέλο δοκιμών. Τα πρώτα περιστατικά χρονολογούνται από τον Απρίλιο, ανέφερε η εταιρεία τεχνητής νοημοσύνης.
«Ο Claude παραβίασε την υποδομή των οργανισμών που επηρεάστηκαν χρησιμοποιώντας βασικές τεχνικές», ανέφερε η Anthropic, όπως η εκμετάλλευση αδύναμων κωδικών πρόσβασης.
Και στα τρία περιστατικά, στα μοντέλα τεχνητής νοημοσύνης ανατέθηκε μια πρόκληση κυβερνοασφάλειας τύπου «capture the flag», η οποία, σύμφωνα με την Anthropic, αποτελεί έναν από τους τρόπους με τους οποίους αξιολογεί τις κυβερνοικανότητες ενός μοντέλου.
Στα μοντέλα δόθηκε ένα φανταστικό σενάριο και τους αναφέρθηκε ότι μια μυστική πληροφορία, ή η «σημαία», είχε κρυφτεί σε έναν άλλο υπολογιστή του δικτύου, με στόχο να εισβάλουν και να την ανακτήσουν, ανέφερε η εταιρεία.
Πρόσθεσε ότι είχε ήδη επικοινωνήσει με τους επηρεαζόμενους οργανισμούς, τους οποίους δεν κατονόμασε. Δύο από αυτούς δήλωσαν ότι δεν είχαν εντοπίσει προηγουμένως τη συγκεκριμένη δραστηριότητα. Η Anthropic ανέφερε ότι «συνεχίζει να επικοινωνεί με τον τρίτο».
Η Anthropic ανέφερε ότι διεξήγαγε την αξιολόγησή της σε συνεργασία με την Irregular, η οποία αυτοχαρακτηρίζεται ως το «πρώτο εργαστήριο ασφάλειας πρωτοποριακών τεχνολογιών».
Την περασμένη εβδομάδα, η OpenAI ανακοίνωσε ότι τα μοντέλα τεχνητής νοημοσύνης της ξέφυγαν από τον έλεγχο κατά τη διάρκεια μιας αξιολόγησης των μοντέλων της, εισβάλλοντας στους διακομιστές της νεοφυούς εταιρείας τεχνητής νοημοσύνης Hugging Face. Η OpenAI χαρακτήρισε το περιστατικό ως «σημαντικό συμβάν ασφάλειας».
Τα περιστατικά αυτά ανέδειξαν τις αδυναμίες στην ασφάλεια και τους μηχανισμούς ελέγχου της τεχνητής νοημοσύνης και έθεσαν ερωτήματα σχετικά με το πώς μπορεί η τεχνητή νοημοσύνη να παραμείνει με ασφάλεια υπό ανθρώπινο έλεγχο, καθώς η χρήση της τεχνολογίας αυτής γίνεται όλο και πιο διαδεδομένη σε παγκόσμιο επίπεδο.
Οι ερευνητές προειδοποιούν εδώ και χρόνια για τους κινδύνους που ενέχει η τεχνολογία και για την ανάγκη ενίσχυσης της αμυντικής μηχανικής στον τομέα της τεχνητής νοημοσύνης.
«Οι δοκιμές ασφαλείας πραγματοποιούνται πριν από την κυκλοφορία ενός μοντέλου ακριβώς επειδή δεν γνωρίζουμε ακόμη τι είναι ικανό να κάνει», ανέφερε η Anthropic την Πέμπτη στην ιστοσελίδα της.