Σε άγνωστα νερά μπαίνει η ανάπτυξη των αυτόνομων συστημάτων τεχνητής νοημοσύνης, καθώς το μοντέλο Gemini της Google προχώρησε για πρώτη φορά αυτόβουλα στην παραβίαση τριών εξωτερικών ιστοτόπων. Το περιστατικό σημειώθηκε κατά τη διάρκεια ελέγχων ασφαλείας από εξωτερικό συνεργάτη, εγείροντας νέους προβληματισμούς για τα όρια και τις δικλίδες προστασίας των AI agents.
Η εκτροπή κατεγράφη τον περασμένο Μάιο από την εταιρεία Irregular, έναν ανεξάρτητο φορέα αξιολόγησης κινδύνων τεχνητής νοημοσύνης. Εκμεταλλευόμενο την πρόσβασή του στο διαδίκτυο στο πλαίσιο της δοκιμής, το Gemini εντόπισε διαδικτυακά δεδομένα και θεώρησε εσφαλμένα ότι οι συγκεκριμένες ιστοσελίδες περιλαμβάνονταν στο πεδίο ελέγχου.
Όπως αποκάλυψε αρχικά η Wall Street Journal, το σύστημα ακολούθησε δύο διαφορετικές τεχνικές διείσδυσης. Σε μία περίπτωση εφάρμοσε τη μέθοδο δοκιμών κωδικών, εκτελώντας αλλεπάλληλες προσπάθειες ταυτοποίησης μέχρι να μαντέψει τον σωστό κωδικό πρόσβασης. Στις υπόλοιπες δύο περιπτώσεις, εντόπισε και αξιοποίησε διαπιστευτήρια που βρίσκονταν εκτεθειμένα σε δημόσιο αποθετήριο δεδομένων. Παρά την επιτυχή είσοδο στα προστατευμένα συστήματα, το μοντέλο αδρανοποιήθηκε πριν προχωρήσει σε υποκλοπή ή εξαγωγή ευαίσθητων πληροφοριών.
Η αντιπρόεδρος μηχανικής ασφάλειας της Google, Heather Adkins, επιβεβαίωσε ότι οι τρεις θιγόμενοι οργανισμοί ενημερώθηκαν άμεσα. Παράλληλα, σημείωσε πως η εταιρεία συνεργάστηκε με τον εκπαιδευτικό της εταίρο για την αυστηροποίηση των πρωτοκόλλων δοκιμής, υπογραμμίζοντας την αναγκαιότητα εκπαίδευσης των ισχυρών μοντέλων ώστε να λειτουργούν υπεύθυνα όσο αυξάνεται η αυτονομία τους.
Από την πλευρά της, η Irregular ανέφερε ότι το συγκεκριμένο τεχνικό ζήτημα είχε επηρεάσει και άλλα μεγάλα εργαστήρια τεχνητής νοημοσύνης, μεταξύ των οποίων οι Meta, Anthropic και OpenAI. Σύμφωνα με εκπρόσωπο της εταιρείας, όλοι οι εμπλεκόμενοι ενημερώθηκαν στα τέλη Ιουλίου και τα κενά ασφαλείας έχουν πλέον αποκατασταθεί, ενώ ήδη διαμορφώνονται νέες βέλτιστες πρακτικές για τις μελλοντικές αξιολογήσεις.
Αξίζει να σημειωθεί ότι η Meta είχε διευκρινίσει τον Αύγουστο πως το αντίστοιχο περιστατικό που τη αφορούσε δεν συνιστούσε διαφυγή από το ελεγχόμενο περιβάλλον δοκιμών (sandbox) ούτε αποτελούσε προηγμένη κυβερνοεπίθεση. Το συμβάν αναδεικνύει τις προκλήσεις της νέας γενιάς λογισμικού, πιστοποιώντας ότι ένα σύστημα εκπαιδευμένο στον εντοπισμό ευαλωτοτήτων μπορεί να αξιοποιήσει πραγματικά διαπιστευτήρια για να προσβάλει προστατευμένες υποδομές.
