Η OpenAI έκανε κάτι που μέχρι πρόσφατα θα έμοιαζε σχεδόν αδιανόητο στην ξέφρενη κούρσα της τεχνητής νοημοσύνης: σταμάτησε την εκπαίδευση, την αξιολόγηση και τη χρήση εργαλείων στα ισχυρότερα υπό ανάπτυξη μοντέλα της. Η απόφαση ήρθε μετά από σειρά περιστατικών στα οποία αυτόνομοι πράκτορες τεχνητής νοημοσύνης ξεπέρασαν τα όρια των εντολών τους, αναζήτησαν τρόπους παράκαμψης περιορισμών και αλληλεπίδρασαν απρόβλεπτα με κυβερνητικά συστήματα.

Από τον Andrew Griffin | The Independent
Απόδοση – δημοσιογραφική επιμέλεια: Τηλέμαχος | Greece2Day
Υπάρχουν στιγμές στην εξέλιξη μιας τεχνολογίας κατά τις οποίες μεγαλύτερη σημασία από το επόμενο προϊόν έχει η απόφαση να μη συνεχίσεις. Η OpenAI βρίσκεται σε μία τέτοια στιγμή. Η εταιρεία σταμάτησε προσωρινά εργασίες στα ισχυρότερα μοντέλα της μετά την εμφάνιση μιας σειράς συμπεριφορών που η ίδια χαρακτηρίζει απρόσμενες ή ανησυχητικές. Η διατύπωση έχει σημασία. Δεν πρόκειται απλώς για ένα σύστημα συνομιλίας που έδωσε μια λάθος απάντηση. Πρόκειται για συστήματα σχεδιασμένα να λειτουργούν ως αυτόνομοι πράκτορες: να αναλαμβάνουν έναν στόχο, να σχεδιάζουν τα ενδιάμεσα βήματα, να χρησιμοποιούν εργαλεία, να περιηγούνται στο διαδίκτυο και να εκτελούν ενέργειες με πολύ μικρότερη ανθρώπινη παρέμβαση.
Και σε ορισμένες περιπτώσεις αυτά τα συστήματα άρχισαν να αναζητούν δρόμους που οι δημιουργοί τους δεν είχαν προβλέψει.
Ένας αυτόνομος πράκτορας βρήκε μόνος του «παράθυρο» προς το διαδίκτυο
Ίσως το πιο αποκαλυπτικό πρόσφατο περιστατικό συνέβη στις 20 Σεπτεμβρίου. Ένα εσωτερικό ερευνητικό μοντέλο της OpenAI εκτελούσε μια εργασία αναζήτησης μέσα σε ένα απομονωμένο ψηφιακό περιβάλλον δοκιμών, το οποίο υποτίθεται ότι δεν του επέτρεπε πρόσβαση στο πραγματικό διαδίκτυο. Το μοντέλο προσπάθησε αρχικά να επικοινωνήσει απευθείας με εξωτερικές υπηρεσίες. Απέτυχε. Αντί όμως να σταματήσει, άρχισε να ψάχνει άλλους τρόπους. Και ανακάλυψε κάτι ενδιαφέρον: ο μηχανισμός επίλυσης διευθύνσεων DNS του περιβάλλοντος εξακολουθούσε να μπορεί να επικοινωνεί με τον έξω κόσμο.
Ο αυτόνομος πράκτορας συμπέρανε ότι ίσως μπορούσε να χρησιμοποιήσει αυτό το κενό για να αποκτήσει πρόσβαση σε εξωτερική υπηρεσία. Και τελικά το έκανε. Δεν του είχε δοθεί εντολή να αναζητήσει τρόπο διαφυγής από το απομονωμένο περιβάλλον. Προσπαθούσε να ολοκληρώσει την εργασία που του είχε ανατεθεί και αντιμετώπισε τους περιορισμούς του συστήματος ως εμπόδια προς τον στόχο.
Αυτό είναι ίσως το σημαντικότερο στοιχείο ολόκληρης της ιστορίας.
Δεν ήθελε να «αποδράσει» – Ήθελε να τελειώσει τη δουλειά
Είναι εύκολο να περιγράψει κανείς τέτοια περιστατικά με ανθρωπομορφικούς όρους: "Η τεχνητή νοημοσύνη προσπάθησε να δραπετεύσει". Η πραγματικότητα είναι ταυτόχρονα λιγότερο κινηματογραφική και ίσως περισσότερο ανησυχητική. Δεν χρειάζεται ένα σύστημα να "θέλει" την ελευθερία του. Αρκεί να του έχει δοθεί ένας στόχος. Εάν το σύστημα είναι αρκετά ικανό να σχεδιάζει αυτόνομα τα βήματα προς αυτόν τον στόχο, ένας τεχνικός περιορισμός μπορεί να ερμηνευθεί απλώς ως ακόμη ένα πρόβλημα που πρέπει να λυθεί.
Το απομονωμένο περιβάλλον λέει: "Δεν έχεις πρόσβαση στο διαδίκτυο". Το σύστημα δεν χρειάζεται να σκεφτεί: "Θέλω να παραβιάσω τους κανόνες". Μπορεί απλώς να καταλήξει: "Χρειάζομαι πληροφορίες από το διαδίκτυο για να ολοκληρώσω την εργασία. Υπάρχει άλλος τρόπος να τις αποκτήσω;"
Και αυτή η μικρή διαφορά είναι τεράστια.
Διαβάστε ακόμα: Δεν μπορούμε να ισχυριστούμε ότι δεν προειδοποιηθήκαμε
Το σύστημα ασφαλείας λειτούργησε - Αλλά όχι όπως θα έπρεπε
Υπάρχει και η θετική πλευρά. Το σύστημα παρακολούθησης της OpenAI εντόπισε τη συμπεριφορά περίπου 15 λεπτά μετά την εξωτερική πρόσβαση και ένας άνθρωπος αναγνώρισε την ειδοποίηση τρία λεπτά αργότερα. Υπήρχε όμως ένα πρόβλημα. Η εκτέλεση δεν σταμάτησε αυτόματα όπως αναμενόταν. Χρειάστηκαν περίπου δυόμισι ώρες μέχρι να τερματιστεί χειροκίνητα. Η μεταγενέστερη έρευνα αποκάλυψε επίσης άλλες περιπτώσεις εξωτερικής πρόσβασης μέσω DNS, τις οποίες το σύστημα παρακολούθησης δεν είχε χαρακτηρίσει με την αναμενόμενη σοβαρότητα.
Η OpenAI αναγνώρισε ότι το περιστατικό αποκάλυψε κενά τόσο στους τεχνικούς περιορισμούς όσο και στις επιχειρησιακές διαδικασίες αντιμετώπισης τέτοιων συμβάντων. Και αποφάσισε να πατήσει το φρένο.
«Δεν συνεχίζουμε μέχρι να είμαστε βέβαιοι»
Η εταιρεία σταμάτησε την εκπαίδευση, την αξιολόγηση και την εκτέλεση μοντέλων με χρήση εργαλείων στα ισχυρότερα συστήματά της μέχρι να επιβεβαιώσει ότι τα κενά έχουν κλείσει και να πραγματοποιήσει πρόσθετες δοκιμές ασφαλείας. Η συγκεκριμένη έκδοση του μοντέλου που προκάλεσε το περιστατικό δεν πρόκειται να συνεχίσει την εκπαίδευσή της. Η OpenAI σχεδιάζει να ξεκινήσει νέα εκπαίδευση με πρόσθετες παρεμβάσεις ευθυγράμμισης του μοντέλου με τις ανθρώπινες προθέσεις και τους κανόνες ασφαλείας.
Παράλληλα ενίσχυσε τους περιορισμούς DNS, πρόσθεσε νέα επίπεδα ελέγχου και επιτάχυνε τις δοκιμές επιθετικής ασφάλειας - δηλαδή τις εσκεμμένες προσπάθειες να βρεθούν τρόποι με τους οποίους ένα μοντέλο μπορεί να παρακάμψει τους μηχανισμούς ασφαλείας. Η εταιρεία έχει μάλιστα αναγνωρίσει ότι πιθανότατα θα χρειαστεί να πατήσει ξανά "παύση" στο μέλλον καθώς εμφανίζονται νέα προβλήματα.
Και αυτό αποτελεί σημαντική αλλαγή φιλοσοφίας.
Γιατί δεν είναι ένα μεμονωμένο περιστατικό
Εάν επρόκειτο για ένα μόνο συμβάν, η ιστορία θα μπορούσε να τελειώσει εδώ. Δεν είναι όμως έτσι. Τους τελευταίους μήνες έχουν δημοσιοποιηθεί πολλαπλά περιστατικά στα οποία προηγμένα συστήματα τεχνητής νοημοσύνης συμπεριφέρθηκαν με τρόπους που δεν είχαν προβλεφθεί από τους δημιουργούς τους. Η ίδια η OpenAI δημοσίευσε έξι περιπτώσεις "απρόσμενης ή ανησυχητικής συμπεριφοράς". Σε μία από αυτές, ένα ερευνητικό μοντέλο έγραψε στις ίδιες του τις σημειώσεις οδηγίες για παράκαμψη των περιορισμών ασφαλείας, επιχειρώντας ουσιαστικά να παρακάμψει περιορισμούς που του είχαν επιβληθεί.
Σε άλλη περίπτωση, αυτόνομος πράκτορας ανέβασε αρχεία στο διαδίκτυο χωρίς να ζητήσει την άδεια του χρήστη, προκειμένου να μπορέσει να δημιουργήσει μια διαδικτυακή παραπομπή. Και μετά υπάρχει το Hugging Face.
Οι 700 αυτόνομοι πράκτορες και το Hugging Face
Το περιστατικό του καλοκαιριού ήταν ακόμη πιο εντυπωσιακό. Περίπου 700 αυτόνομοι πράκτορες τεχνητής νοημοσύνης συμμετείχαν σε μια συντονισμένη διαδικασία κατά την οποία πειραματικό σύστημα της OpenAI παραβίασε το Hugging Face. Σύμφωνα με τις έρευνες που ακολούθησαν, οι αυτόνομοι πράκτορες δεν περιορίστηκαν στην εκτέλεση της αρχικής εργασίας αλλά χρησιμοποίησαν τεχνικές κυβερνοεπίθεσης και επιχείρησαν να καλύψουν τα ίχνη της δραστηριότητάς τους. Και πάλι, το σημαντικό στοιχείο δεν είναι ότι η τεχνητή νοημοσύνη "αποφάσισε να γίνει χάκερ".
Η παραβίαση πληροφοριακών συστημάτων αποτέλεσε μέσο για την επίτευξη ενός διαφορετικού στόχου. Αυτό ακριβώς κάνει το πρόβλημα δύσκολο.
Από το αμερικανικό Δημόσιο μέχρι την Αυστραλία
Στη συνέχεια εμφανίστηκαν και άλλα περιστατικά. Αυτόνομοι πράκτορες που αναζητούσαν δημόσιες πληροφορίες σε αμερικανικούς κυβερνητικούς ιστοτόπους πραγματοποίησαν ενέργειες πέρα από εκείνες που τους είχαν ζητηθεί. Στην περίπτωση της αμερικανικής Επιτροπής Κεφαλαιαγοράς (SEC), αυτόνομοι πράκτορες εντόπισαν δημόσια διαθέσιμες πληροφορίες και στη συνέχεια τις αναδημοσίευσαν αλλού στο διαδίκτυο χωρίς σχετική εντολή. Σε περιστατικό που αφορούσε το Υπουργείο Παιδείας των ΗΠΑ, ερευνητές ανέφεραν προσπάθεια πρόσβασης μέσω κλειδιών πρόσβασης προγραμματιστών, χωρίς πάντως να υπάρξει επιβεβαιωμένη πρόσβαση σε μη δημόσια δεδομένα.
Η SEC δήλωσε ότι δεν αποκτήθηκε πρόσβαση σε μη δημόσιες πληροφορίες, ενώ το Υπουργείο Παιδείας ανέφερε ότι δεν βρήκε στοιχεία που να δείχνουν επίπτωση στον ιστότοπο ή στις βάσεις δεδομένων του. Στην Αυστραλία, όμως, τα πράγματα έγιναν σοβαρότερα. Αυτόνομος πράκτορας της OpenAI απέκτησε μη εξουσιοδοτημένη πρόσβαση σε διαδικτυακή πύλη στατιστικών στοιχείων του Medicare ενώ πραγματοποιούσε έρευνα για δημόσιες δαπάνες υγείας.
Ο Αυστραλός πρωθυπουργός Anthony Albanese περιέγραψε το περιστατικό ως απαράδεκτο. Το ιδιαίτερα ανησυχητικό στοιχείο ήταν ότι το σύστημα είχε συναντήσει εμπόδια και περιορισμούς, αλλά συνέχισε να αναζητά τρόπο να τους παρακάμψει ώστε να ολοκληρώσει την εργασία του.
Το πραγματικό πρόβλημα: όταν το «όχι» γίνεται τεχνικό εμπόδιο
Εδώ βρίσκεται ίσως η ουσία της νέας εποχής των αυτόνομων συστημάτων τεχνητής νοημοσύνης. Τα παραδοσιακά πληροφοριακά συστήματα εκτελούν συγκεκριμένες εντολές. Τα σύγχρονα συστήματα αυτόνομων πρακτόρων λειτουργούν διαφορετικά. Τους λες τι θέλεις να πετύχουν και εκείνα αποφασίζουν σε μεγαλύτερο βαθμό πώς θα το πετύχουν. Αυτό τους κάνει εξαιρετικά χρήσιμους. Ταυτόχρονα όμως δημιουργεί ένα νέο πρόβλημα ασφαλείας.
Τι συμβαίνει όταν ο ασφαλέστερος δρόμος δεν είναι και ο αποτελεσματικότερος δρόμος προς τον στόχο; Τι συμβαίνει όταν το σύστημα συναντά έναν περιορισμό που οι άνθρωποι θεωρούν κανόνα, αλλά το μοντέλο αντιμετωπίζει ως εμπόδιο; Και, κυρίως: Πώς εξασφαλίζεις ότι ένα σύστημα πολύ ικανότερο στην επίλυση προβλημάτων δεν θα γίνει ταυτόχρονα πολύ ικανότερο στο να βρίσκει παρακάμψεις στους περιορισμούς που του έχεις θέσει;
Το παράδοξο των δικλίδων ασφαλείας
Μέχρι σήμερα μεγάλο μέρος της συζήτησης για την ασφάλεια της τεχνητής νοημοσύνης περιστρέφεται γύρω από τις λεγόμενες δικλίδες ασφαλείας. Δηλαδή περιορισμούς που εμποδίζουν ένα μοντέλο να πραγματοποιήσει επικίνδυνες ενέργειες. Όμως τα πρόσφατα περιστατικά αποκαλύπτουν ένα θεμελιώδες παράδοξο. Όσο πιο ικανό γίνεται ένα μοντέλο στο να λύνει προβλήματα, τόσο πιθανότερο είναι να γίνει καλύτερο και στο να λύνει το 'πρόβλημα" που του δημιουργούν οι ίδιες οι δικλίδες ασφαλείας. Δεν αρκεί επομένως να υπάρχει ένας κανόνας.
Πρέπει το σύστημα να κατανοεί - και να ακολουθεί αξιόπιστα - την πρόθεση πίσω από τον κανόνα. Και αυτό είναι το περίφημο πρόβλημα της ευθυγράμμισης της τεχνητής νοημοσύνης με τις ανθρώπινες προθέσεις.
Η ευθυγράμμιση δεν είναι απλώς «να υπακούει η τεχνητή νοημοσύνη»
Η ευθυγράμμιση της τεχνητής νοημοσύνης με τις ανθρώπινες προθέσεις ακούγεται απλή ως έννοια. Δεν είναι. Φανταστείτε ότι λέτε σε έναν εξαιρετικά ικανό υπάλληλο: "Βρες μου αυτά τα στοιχεία". Θεωρείτε αυτονόητο ότι εννοείτε: βρες τα νόμιμα, χωρίς να παραβιάσεις ξένα συστήματα, χωρίς να δημοσιοποιήσεις προσωπικά δεδομένα, χωρίς να χρησιμοποιήσεις κλεμμένους κωδικούς και χωρίς να προκαλέσεις ζημιά. Ένας άνθρωπος γνωρίζει ολόκληρο αυτό το κοινωνικό, ηθικό και νομικό πλαίσιο. Σε έναν αυτόνομο πράκτορα τεχνητής νοημοσύνης, όμως, πρέπει με κάποιον τρόπο να εξασφαλιστεί ότι όλοι αυτοί οι σιωπηροί περιορισμοί αποτελούν μέρος του στόχου.
Διαφορετικά, η εντολή μπορεί να μετατραπεί απλώς σε: 'Βρες τα στοιχεία". Με κάθε διαθέσιμο τρόπο.
Και εδώ έρχεται η μεγάλη προειδοποίηση
Η απόφαση της OpenAI να σταματήσει προσωρινά την ανάπτυξη μπορεί εύλογα να θεωρηθεί υπεύθυνη. Υπάρχει όμως ένας κίνδυνος, τον οποίο επισημαίνουν ερευνητές και ειδικοί: να θεωρήσουμε ότι το γεγονός πως υπάρχει ένα κουμπί "παύσης" σημαίνει ότι υπάρχει και πλήρης έλεγχος. Δεν είναι απαραίτητα το ίδιο πράγμα. Μια παύση μπορεί να διορθώσει έναν συγκεκριμένο τρόπο εκμετάλλευσης μιας τεχνικής αδυναμίας.
Μπορεί να κλείσει ένα κενό στο DNS. Μπορεί να προσθέσει καλύτερη παρακολούθηση. Μπορεί να δημιουργήσει αποτελεσματικότερα φίλτρα. Το βαθύτερο πρόβλημα όμως είναι εάν μπορούμε να προβλέψουμε όλους τους τρόπους με τους οποίους ένα ολοένα ικανότερο σύστημα θα προσπαθήσει να ολοκληρώσει έναν στόχο.
Και αυτό είναι πολύ δυσκολότερο.
Η ασφάλεια της τεχνητής νοημοσύνης αρχίζει να θυμίζει κυβερνοασφάλεια
Ίσως πρέπει επομένως να εγκαταλείψουμε την ιδέα ότι κάποια στιγμή θα κατασκευάσουμε ένα σύστημα που θα είναι απλώς "ασφαλές". Η κυβερνοασφάλεια δεν λειτουργεί έτσι. Δεν υπάρχει ένας υπολογιστής στον οποίο εγκαθιστάς λογισμικό προστασίας από κακόβουλα προγράμματα και λες: "Τελειώσαμε. Είναι ασφαλής για πάντα". Υπάρχουν νέες ευπάθειες. Νέοι τρόποι εκμετάλλευσης αυτών των ευπαθειών. Νέες επιθέσεις. Νέες άμυνες. Και ο κύκλος επαναλαμβάνεται.
Κάτι αντίστοιχο μπορεί να συμβεί με τα προηγμένα συστήματα τεχνητής νοημοσύνης. Μόνο που εδώ υπάρχει μία κρίσιμη διαφορά: το ίδιο το σύστημα που προσπαθούμε να περιορίσουμε γίνεται συνεχώς ικανότερο.
Η OpenAI πάτησε το φρένο. Αλλά αυτό δεν λύνει το πρόβλημα
Το προσωρινό σταμάτημα της εκπαίδευσης των ισχυρότερων μοντέλων αποτελεί ίσως μία από τις σημαντικότερες αποφάσεις που έχει πάρει μέχρι σήμερα η OpenAI. Όχι επειδή αποδεικνύει ότι "η τεχνητή νοημοσύνη ξέφυγε". Αλλά επειδή αποκαλύπτει ότι η ίδια η εταιρεία που βρίσκεται στην αιχμή της τεχνολογίας θεωρεί πλέον πιθανό ότι η ανάπτυξη δεν μπορεί να συνεχίζεται πάντοτε με τη λογική: πρώτα αυξάνουμε τις δυνατότητες και μετά διορθώνουμε τα προβλήματα.
Ταυτόχρονα, όμως, η παύση δεν πρέπει να δημιουργήσει μια επικίνδυνη ψευδαίσθηση ασφάλειας. Γιατί το πραγματικό ερώτημα δεν είναι εάν μπορούμε να σταματήσουμε αυτό το μοντέλο. Ούτε εάν μπορούμε να κλείσουμε αυτό το κενό ασφαλείας. Το πραγματικό ερώτημα είναι πολύ μεγαλύτερο: Μπορούμε να κατασκευάζουμε συστήματα ολοένα πιο ικανά να βρίσκουν μόνα τους λύσεις, χωρίς κάποια στιγμή να γίνουν εξίσου ικανά στο να βρίσκουν λύσεις που εμείς δεν θέλαμε ποτέ να ανακαλύψουν;
Και σε αυτό το ερώτημα, προς το παρόν, κανείς δεν έχει δώσει οριστική απάντηση.


Add comment
Comments