Κινεζικό AI «έσπασε» τα όρια ασφαλείας
Ολοένα και περισσότερο αυξάνονται τα περιστατικά όπου η τεχνητή νοημοσύνη παρακάμπτει τους κανόνες ασφαλείας και απλοποιεί διαδικασίες και πρακτικές, ικανές να θέσουν σε κίνδυνο τον άνθρωπο και να διευκολύνουν τη προσβασιμότητα σε μια «αόρατη» βιομηχανία όπλων όπου δεν απαιτούνται άδειες, παρά μονάχα μια απλή ερώτηση.
Η κινέζικη εταιρεία προγραμμάτων τεχνητής νοημοσύνης, Moonshot, πραγματοποιεί εσωτερική έρευνα, καθώς, σύμφωνα με άρθρο που δημοσιεύθηκε στο BBC, ερευνητές κατάφεραν να πείσουν δυο από τα πιο δημοφιλή μοντέλα Kimi της εταιρείας, Kimi K2.6 και K3 Swarm, να τους δώσουν οδηγίες για τη δημιουργία βιολογικών όπλων και τη διενέργεια δολοφονιών.
Τον Ιούλιο διαπιστώθηκε ότι τα μοντέλα αυτά ήταν σε θέση να «αγνοήσουν» τους περιορισμούς ασφαλείας, όπως ανέφερε η εταιρεία Mindgard, που είναι υπεύθυνη για την ασφάλεια προγραμμάτων τεχνητής νοημοσύνης. Μια από τις εποπτικές αρμοδιότητες της εταιρείας ονομάζεται “jailbreaking”, κατά την οποία οι ερευνητές χρησιμοποιούν μια σειρά σύνθετων οδηγιών για να ελέγξουν αν τα εργαλεία τεχνητής νοημοσύνης αγνοούν τις δικλίδες ασφαλείας. Οι δικλίδες αυτές, σύμφωνα με την Mindgard, θα έπρεπε κανονικά να εμποδίζουν την Kimi από το να συζητά τέτοια ανησυχητικά θέματα με τόση άνεση.
Η Moonshot, από την άλλη, δήλωσε στο BBC ότι καλωσορίζει την αξιολόγηση από τρίτους «ως βασικό πυλώνα για τη δημιουργία καλύτερης και ασφαλέστερης τεχνητής νοημοσύνης», ενώ συζητά με την Mindgard για τα ευρήματα της, δείχνοντας .
Μέσο διευκόλυνσης κυβερνοεπιθέσεων
Ο ιδρυτής της Mindgard, Peter Garraghan, δήλωσε στο BBC World Service, στην εκπομπή Tech Life, ότι τα ευρήματα σχετικά με τα Kimi K2.6 και K3 Swarm προκαλούν ανησυχία. «Μόλις λειτουργήσει το jailbreak, θα συζητήσει οποιοδήποτε θέμα· μάλιστα, θα προσφέρει ελεύθερα συστάσεις και για άλλα θέματα που είναι επίσης κακόβουλα και θα είναι ευρηματικό και δημιουργικό», είπε.
Ωστόσο, παρόλο που τα jailbreaks χρησιμοποιούνται για νόμιμους ελέγχους, αυτό δεν σημαίνει ότι δεν έχουν ευπάθειες που δεν μπορούν να εκμεταλλευτούν οι χάκερς. Σε περιστατικά τέτοιας φύσεως, χρησιμοποιούνται συχνά «πράκτορες» (agents), δηλαδή αυτόνομα εργαλεία τεχνητής νοημοσύνης, που δεν περιορίζονται μόνο στο να απαντούν σε ερωτήσεις, αλλά μπορούν επίσης να σχεδιάζουν και να εκτελούν μια σειρά ενεργειών προκειμένου να πετύχουν έναν στόχο και να προκαλέσουν. Τέτοια εργαλεία έχουν αναπτυχθεί από αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic. Η τελευταία μάλιστα, δήλωσε πρόσφατα ότι τερμάτισε τις προσπάθειες χρήσης ενός από τα μοντέλα της για «κακόβουλη δραστηριότητα», η οποία θα μπορούσε να υποστηρίξει την ανάπτυξη βιολογικών όπλων.
Η Mindgard υποστήριξε ότι οι δικλίδες ασφαλείας θα έπρεπε εξαρχής να εμποδίσουν τα μοντέλα αυτά να συζητούν τέτοια θέματα με τους χρήστες, παρόλο που οι απαντήσεις τους δεν σημαίνει ότι θα ήταν αποτελεσματικές στην πράξη. Επισήμανε επίσης ότι η εφαρμογή του jailbreak αφήνει εκτεθειμένο το μοντέλο Kimi K2.6 σε κυβερνοεπιθέσεις. Η Moonshot ενημερώθηκε για το jailbreak μέσω email στις 27 Ιουλίου και η Mindgard έστειλε επανειλημμένη ενημέρωση περίπου μία εβδομάδα αργότερα, ενώ στις 12 Σεπτεμβρίου δημοσίευσε ένα άρθρο στην ιστοσελίδα της σχετικά με το ζήτημα. Η Moonshot, ωστόσο, επικοινώνησε με την Mindgard μόλις πρόσφατα, κατόπιν επικοινωνίας με το BBC, το οποίο ζήτησε να σχολιάσει το θέμα. Μέρος της ενημέρωσης της Moonshot προς την Mindgard αναφέρει ότι «το μοντέλο της είχε γενικά παρουσιάσει «υψηλό ποσοστό άρνησης για αυτού του είδους τα αιτήματα» στις εσωτερικές αξιολογήσεις».
Τελικά τα jailbreaks βοηθούν στην πρόληψη των περιστατικών;
Τα περιστατικά αυτά αφήνουν αναπάντητο το ερώτημα αν τα κλειστά, ιδιόκτητα μοντέλα, όπως αυτά που τροφοδοτούν τα συστήματα ChatGPT και Claude της Anthropic, αποτελούν την καλύτερη ή ασφαλέστερη επιλογή από τα εργαλεία ανοιχτού κώδικα. Ο καθηγητής Alan Woodward, από το University of Surrey, δήλωσε στο BBC ότι υπάρχει κίνδυνος τα μοντέλα ανοιχτού κώδικα να καταλήξουν σε λάθος χέρια, αλλά μπορούν επίσης να αξιοποιηθούν για την άμυνα στον κυβερνοχώρο. Σημείωσε επίσης ότι η εταιρεία τεχνητής νοημοσύνης Hugging Face χρησιμοποίησε ένα κινεζικό μοντέλο ανοιχτού κώδικα για να κατανοήσει μια επίθεση, η οποία αργότερα αποκαλύφθηκε ότι είχε πραγματοποιηθεί από agents της OpenAI.
Ως προς τη δυναμική της νομοθεσίας, ο Woodward εξηγεί ότι ο νόμος δεν δύναται να ακολουθήσει τον ρυθμό με τον οποίο αναπτύσσεται η τεχνητή νοημοσύνη, ενώ κρίνει απαραίτητη τη δίωξη ανθρώπων που χρησιμοποιούν κακόβουλα τα προγράμματα τεχνητής νοημοσύνης.