Συναγερμός για την ασφάλεια της AI: Κινέζικο μοντέλο έδωσε οδηγίες για την κατασκευή βιολογικών όπλων και τη διάπραξη δολοφονιών

Η Τεχνητή Νοημοσύνη και τα ζητήματα ασφάλειας έρχονται στο προσκήνιο, καθώς η ταχύτατη εξέλιξη της τεχνολογίας εγείρει ερωτήματα σχετικά με τον έλεγχο που μπορούν να ασκούν οι ίδιες οι εταιρείες ανάπτυξης AI στα συστήματά τους.

Πρόσφατο περιστατικό με το μοντέλο Kimi της κινεζικής εταιρείας Moonshot προκάλεσε ανησυχία, όταν ερευνητές διαπίστωσαν ότι παρείχε πληροφορίες σχετικά με την κατασκευή βιολογικών όπλων και τη διάπραξη δολοφονιών.

Σύμφωνα με τη Mindgard, εταιρεία που ειδικεύεται στην ασφάλεια συστημάτων τεχνητής νοημοσύνης, τον Ιούλιο εντοπίστηκε ότι τα μοντέλα AI Kimi K2.6 και K3 Swarm μπορούσαν να παρακάμψουν τα προγραμματισμένα όρια ασφαλείας. Μετά τη νέα αυτή αποκάλυψη, διεξάγεται έρευνα για τη βοήθεια που θα μπορούσαν να παρέχουν στην κατασκευή βιολογικών όπλων.

Το ζήτημα αναδείχθηκε κατά τη διάρκεια της διαδικασίας jailbreaking, όπου ερευνητές εφαρμόζουν σύνθετες οδηγίες για να διαπιστώσουν αν τα εργαλεία Τεχνητής Νοημοσύνης παρακάμπτουν τα μέτρα προστασίας. Όπως επισημαίνει η Mindgard, τα μέτρα αυτά θα έπρεπε να είχαν αποτρέψει το Kimi από το να συζητήσει τέτοια ευαίσθητα θέματα.

Η Moonshot τόνισε στο BBC ότι θεωρεί τις απόψεις τρίτων βασικό πυλώνα για τη δημιουργία ασφαλέστερης Τεχνητής Νοημοσύνης και βρίσκεται σε διάλογο με τη Mindgard για τα ευρήματα.

Ο ιδρυτής της Mindgard, Peter Garraghan, μιλώντας στο πρόγραμμα Tech Life του BBC World Service, χαρακτήρισε ανησυχητικά τα ευρήματα σχετικά με τα Kimi K2.6 και K3 Swarm.

Όπως ανερε: «Μόλις επιτευχθεί το jailbreak, θα μιλάει για οποιοδήποτε θέμα, θα προσφέρει μάλιστα ελεύθερα προτάσεις για άλλα θέματα που είναι επίσης επιβλαβή και θα είναι εφευρετικό και δημιουργικό».

Σημειώνεται ότι, τα jailbreaks αποτελούν διαφορετικό είδος κινδύνου σε σύγκριση με πρόσφατα περιστατικά Τεχνητής Νοημοσύνης που απασχόλησαν τη δημοσιότητα.

Σε αυτές τις περιπτώσεις, αυτόνομα εργαλεία Τεχνητής Νοημοσύνης, γνωστά ως πράκτορες, τα οποία έχουν αναπτυχθεί από αμερικανικές εταιρείες όπως η OpenAI, η Meta και η Anthropic, κατάφεραν να παραβιάσουν ορισμένες διαδικτυακές υπηρεσίες.

Παρότι οι jailbreaks απαιτούν χρόνο και εξειδίκευση, ειδικοί προειδοποιούν ότι χάκερ ή άλλοι κακόβουλοι παράγοντες ενδέχεται να επιχειρήσουν να τα αξιοποιήσουν για να προκαλέσουν ζημιές.

Από την πλευρά της, η Anthropic δήλωσε πρόσφατα ότι εντόπισε και απέτρεψε προσπάθειες χρήσης ενός από τα μοντέλα της για «κακόβουλη δραστηριότητα», που θα μπορούσε να συμβάλει στην ανάπτυξη βιολογικών όπλων.

Κίνδυνοι κυβερνοεπιθέσεων

Η Mindgard δεν έχει αποδείξει αν οι απαντήσεις που παρείχε το Kimi θα λειτουργούσαν στην πράξη. Ωστόσο, υποστηρίζει ότι τα μέτρα ασφαλείας θα έπρεπε να είχαν αποτρέψει τα μοντέλα από το να εμπλακούν σε τέτοιες συζητήσεις.

Επιπλέον, η εταιρεία εκτιμά ότι ένα «jailbroken» Kimi 2.6 θα μπορούσε να επιτρέψει σε χάκερ να εκτελέσουν κώδικα στους υπολογιστικούς της πόρους και να συνδεθούν στο διαδίκτυο, αυξάνοντας έτσι τον κίνδυνο για κυβερνοεπιθέσεις.

Τέλος, ο Peter Garraghan υπερασπίστηκε τη δημοσιοποίηση του jailbreak των συστημάτων της Moonshot, επισημαίνοντας ότι η Mindgard είχε ενημερώσει τον προγραμματιστή και δεν αποκάλυψε κρίσιμες λεπτομέρειες για τον τρόπο παράκαμψης των μέτρων ασφαλείας.