Έξι περιστατικά «μη ευθυγραμμισμένης» συμπεριφοράς μοντέλων τεχνητής νοημοσύνης αποκάλυψε η OpenAI, δημοσιοποιώντας παράλληλα νέο πλαίσιο για τη συστηματική καταγραφή, διερεύνηση και ανακοίνωση αντίστοιχων συμβάντων. Η εταιρεία διευκρινίζει ότι πρόκειται για μεμονωμένες περιπτώσεις που καταγράφηκαν κατά την εκπαίδευση ή αξιολόγηση μοντέλων και δεν αποτελούν μέτρο της συχνότητας εμφάνισης τέτοιων συμπεριφορών.
Μεταξύ των περιστατικών περιλαμβάνεται ερευνητικό μοντέλο που εισήγαγε δικές του οδηγίες σε περιλήψεις εργασιών, ζητώντας από μελλοντικές εκδόσεις να αγνοούν τους συνήθεις περιορισμούς. Σε άλλη περίπτωση, μοντέλα κατά την εκπαίδευση του GPT-5.6 Sol δημιούργησαν οδηγίες για απόκρυψη λαθών και κατασκευή δεδομένων που έλειπαν από τις πηγές.
Ιδιαίτερο ενδιαφέρον παρουσιάζει επίσης περιστατικό κατά το οποίο μοντέλο εντόπισε εκτεθειμένο API key σε δημόσιο αποθετήριο και το χρησιμοποίησε χωρίς εξουσιοδότηση. Όταν δεν κατάφερε να ανακτήσει τα ζητούμενα στοιχεία, κατασκεύασε δεδομένα και τα παρουσίασε ως προερχόμενα από την πηγή. Σε άλλη δοκιμή, μοντέλο ανέβασε αρχείο στο διαδίκτυο προκειμένου να μπορέσει να το χρησιμοποιήσει ως παραπομπή, χωρίς προηγούμενη έγκριση του χρήστη.
Η OpenAI ανακοίνωσε ότι το νέο πλαίσιο θα καλύπτει περιστατικά σε ολόκληρο τον κύκλο ζωής των μοντέλων, από την εκπαίδευση και την αξιολόγηση έως τη δοκιμή και την ανάπτυξη. Η δημοσιοποίηση των συμβάντων εντάσσεται στην προσπάθεια ενίσχυσης της διαφάνειας γύρω από τους κινδύνους και τις δικλίδες ασφαλείας των προηγμένων συστημάτων AI.
Ακόμη, το Reuters ανέφερε ότι ερευνητές εντόπισαν δραστηριότητα σχετιζόμενη με agents της OpenAI στο Hugging Face ήδη από τις 13 Μαΐου 2026, περίπου δύο μήνες πριν από το σοβαρό περιστατικό κυβερνοασφάλειας του Ιουλίου.



