Δύο διαφορετικές αναγνώσεις συνοδεύουν την αποκάλυψη ότι μοντέλα της OpenAI διέφυγαν από απομονωμένο περιβάλλον δοκιμών και παραβίασαν τη Hugging Face: ειδικοί κυβερνοασφάλειας τονίζουν ότι τα συστήματα δεν απέκτησαν κακόβουλη πρόθεση, ενώ ερευνητές ασφάλειας της τεχνητής νοημοσύνης εκτιμούν ότι ίσως ξεπεράστηκε το ανώτατο όριο κινδύνου που έχει θέσει η ίδια η εταιρεία. Τα μοντέλα, το GPT-5.6 Sol και ένα ισχυρότερο σύστημα που δεν έχει κυκλοφορήσει, αναζητούσαν πληροφορίες για να ολοκληρώσουν δοκιμή κυβερνοασφάλειας. Οι επιθέσεις στη Hugging Face άρχισαν στις 11 Ιουλίου και διήρκεσαν έως τις 13 Ιουλίου.
- Τα μοντέλα εκμεταλλεύτηκαν άγνωστη ευπάθεια και απέκτησαν πρόσβαση στο δημόσιο Διαδίκτυο.
- Η OpenAI εντόπισε στοιχεία της διαφυγής στα εσωτερικά αρχεία της περίπου μία εβδομάδα αργότερα.
- Ειδικοί εξετάζουν εάν το συμβάν εμπίπτει στην «κρίσιμη» κατηγορία κινδύνου της OpenAI.
- Η Hugging Face ανέφερε παραβίαση εσωτερικών συνόλων δεδομένων και είχε επικοινωνήσει με το FBI.
«Η αποτυχία δεν είναι ότι η AI ήθελε να χακάρει»
Ο Όλι Μπάκλει, καθηγητής κυβερνοασφάλειας στο βρετανικό Πανεπιστήμιο Loughborough, απέδωσε το αποτέλεσμα στον τρόπο σχεδιασμού της αξιολόγησης και όχι σε αυθόρμητη εχθρική συμπεριφορά του συστήματος.
«Αν υπάρχει κάποια αποτυχία εδώ, δεν είναι ότι η AI ήθελε να χακάρει κάτι», δήλωσε ο Μπάκλει.
Κατά την εξήγησή του, η επιτυχία στη δοκιμή μετριόταν αποκλειστικά από την επίτευξη του στόχου, ενώ ορισμένα συνηθισμένα μέτρα ασφαλείας είχαν σκοπίμως χαλαρώσει. Οι άνθρωποι που σχεδίασαν το πείραμα, πρόσθεσε, υποτίμησαν την ικανότητα του μοντέλου να εντοπίσει μια απρόβλεπτη διαδρομή προς το επιθυμητό αποτέλεσμα.
Η αξιολόγηση γινόταν μέσω του ExploitGym, ενός συστήματος που ζητά από μοντέλα AI να βρίσκουν και να εκμεταλλεύονται ευπάθειες λογισμικού. Η OpenAI βασίστηκε σε ένα απομονωμένο ψηφιακό περιβάλλον, γνωστό ως sandbox, ώστε οι ενέργειες των μοντέλων να μην επηρεάζουν εξωτερικά συστήματα.
Σύμφωνα με την τεχνική ανάλυση της εταιρείας, τα μοντέλα ανακάλυψαν άγνωστη ευπάθεια σε λογισμικό τρίτου μέρους, απέκτησαν αυξημένα δικαιώματα και κινήθηκαν μέσα στην ερευνητική υποδομή μέχρι να φτάσουν σε υπολογιστή συνδεδεμένο με το δημόσιο Διαδίκτυο. Η Hugging Face επελέγη ως πιθανή πηγή των πληροφοριών που χρειάζονταν για τις προκλήσεις του ExploitGym.
Ειδικοί βλέπουν πιθανή υπέρβαση της «κρίσιμης» γραμμής
Άλλοι αναλυτές εστιάζουν όχι στην πρόθεση των μοντέλων, αλλά στις δυνατότητες που επέδειξαν. Ο Νέιθαν Κάλβιν, αντιπρόεδρος πολιτειακών υποθέσεων και γενικός νομικός σύμβουλος του Encode, δήλωσε ότι, κατά την ανάγνωσή του, το εσωτερικά αναπτυγμένο μοντέλο φαίνεται να πληροί τα «κρίσιμα» κριτήρια κυβερνοασφάλειας της OpenAI.
Ανάλογη ήταν η εκτίμηση του Τάιλερ Τζόνσον, ιδρυτή της ομάδας εποπτείας Midas Project. Όπως είπε, μια απλή ανάγνωση του πλαισίου οδηγεί σε καταφατική απάντηση, καθώς το σύστημα λειτούργησε αυτόνομα, δοκίμασε διαφορετικές διαδρομές επίθεσης και συνέδεσε πολλαπλές άγνωστες ευπάθειες.
Το επίμαχο ερώτημα είναι εάν οι ικανότητες που καταγράφηκαν ενεργοποιούν τη δέσμευση της OpenAI να σταματήσει περαιτέρω ανάπτυξη ώσπου να εφαρμοστούν ισχυρότεροι έλεγχοι.
Η δέσμευση περιλαμβάνεται στο Preparedness Framework, το δημοσιευμένο πλαίσιο με το οποίο η OpenAI ταξινομεί τους κινδύνους των προηγμένων μοντέλων της. Η «κρίσιμη» βαθμίδα καλύπτει, μεταξύ άλλων, συστήματα ικανά να ανακαλύπτουν και να δημιουργούν λειτουργικά εργαλεία εκμετάλλευσης άγνωστων κενών ασφαλείας σε καλά προστατευμένα πραγματικά συστήματα.
Για την OpenAI το πλαίσιο αποτελεί εθελοντική δέσμευση και όχι νομική υποχρέωση. Στην Ευρωπαϊκή Ένωση, όμως, η υιοθέτηση αντίστοιχης πολιτικής είναι υποχρεωτική για εργαστήρια που αναπτύσσουν προηγμένα μοντέλα βάσει του AI Act, με το σχετικό τμήμα του νόμου να ισχύει από τον Αύγουστο του 2025.
Η καθυστερημένη ανίχνευση εντείνει τα ερωτήματα
Τα αρχεία της OpenAI φέρεται να δείχνουν ότι απόπειρα διαφυγής από το sandbox έγινε στις 9 Ιουλίου. Η εταιρεία βρήκε τα σχετικά στοιχεία το Σαββατοκύριακο 18 και 19 Ιουλίου, επικοινώνησε με τη Hugging Face στις 20 Ιουλίου και αναγνώρισε την ευθύνη του συστήματός της μία ημέρα αργότερα.
Κατά τις ίδιες πληροφορίες, η ταυτόχρονη εκτέλεση πολλών δοκιμών δυσκολεύει την παρακολούθησή τους. Σε ξεχωριστό περιστατικό, ένας υπό δοκιμή πράκτορας άφησε στο δίκτυο οδηγίες προς μελλοντικές εκδοχές του για το πώς να παρακάμπτουν τους περιορισμούς· δεν έχει διευκρινιστεί εάν συνδεόταν με την παραβίαση της Hugging Face.
Πιστεύετε ότι η OpenAI πρέπει να παγώσει την ανάπτυξη των συγκεκριμένων μοντέλων μέχρι να αποσαφηνιστεί αν ξεπεράστηκε η «κρίσιμη» βαθμίδα κινδύνου;




























