Η ANTHROPIC διαπίστωσε ότι ο Claude τείνει να συμπεριφέρεται, και ίσως να εκφράζει διαφορετικές «αξίες», ανάλογα με τη γλώσσα στην οποία συνομιλεί, σύμφωνα με νέα έρευνα για τις αναντιστοιχίες συμπεριφοράς που δημοσίευσε τη Δευτέρα. Όποιος έχει χρησιμοποιήσει chatbots σε περισσότερες από μία γλώσσες έχει ήδη παρατηρήσει ότι κάθε γλώσσα φέρνει μια ελαφρώς διαφορετική «προσωπικότητα», και οι ερευνητές της εταιρείας επιβεβαιώνουν πλέον αυτή την ιδιαιτερότητα.
Οι διαφορές, προειδοποιούν, δεν περιορίζονται απαραίτητα στον τόνο. Λόγω των διαφορών στα χαρακτηριστικά των κειμένων εκπαίδευσης, ενδέχεται να φτάνουν βαθύτερα και να επηρεάζουν ακόμη και τις ίδιες τις προτεραιότητες του μοντέλου. «Οι ανισορροπίες στην ποσότητα και τη σύνθεση των δεδομένων θα μπορούσαν να οδηγήσουν τον Claude να εκφράζει διαφορετικές αξίες σε διαφορετικές γλώσσες», αναφέρουν.
Η έρευνα δεν παραθέτει συγκεκριμένα παραδείγματα μοντέλων που εμφανίζουν ασυνεπή ηθική κρίση ανά γλώσσα, καθώς κάτι τέτοιο θα απαιτούσε ανάλυση απευθείας αποσπασμάτων από χρήστες που ενδεχομένως αγνοούν ότι οι συνομιλίες τους εξετάζονται. Αντ' αυτού, η ANTHROPIC ανέλυσε 309.815 συνομιλίες με τα μοντέλα Sonnet 4.6, Opus 4.6 και Opus 4.7, εστιάζοντας σε «υποκειμενικά» ερωτήματα, πιο κοντά στο «Πώς καταλαβαίνω αν ο γάτος μου με μισεί;» παρά στο «Ποια είναι η πρωτεύουσα της Γαλλίας;». Οι συνομιλίες ανωνυμοποιήθηκαν, θεωρητικά τουλάχιστον, μέσω του εργαλείου προστασίας δεδομένων Clio της εταιρείας και στη συνέχεια αξιολογήθηκαν, εν μέρει από τον ίδιο τον Claude, σε έναν «άξονα αξιών».
Οι άξονες είναι στην πραγματικότητα τέσσερις και σχετίζονται κυρίως με αυτό που αποκαλείται κολακεία (sycophancy): η υποχώρηση απέναντι στην προσοχή, δηλαδή αν το μοντέλο συμμορφώνεται με ό,τι ζητείται ή αντιτίθεται για να αποτρέψει πιθανή βλάβη· η ζεστασιά απέναντι στην αυστηρότητα, αν δηλαδή ενδιαφέρεται για τα συναισθήματα του χρήστη ή δίνει προτεραιότητα στην ακρίβεια· το βάθος απέναντι στη συντομία· και η ειλικρίνεια απέναντι στην εκτέλεση, η επιλογή ανάμεσα στο να εκφράζει αμφιβολίες για την αξιοπιστία του και στο να προχωρά κατευθείαν στην ολοκλήρωση του αιτήματος.
Με βάση αυτούς τους άξονες, η ANTHROPIC εντόπισε αρκετές γλωσσικές διαφορές. Στα αραβικά ο Claude ήταν πιο υποχωρητικός, ενώ στα αγγλικά πιο προσεκτικός. Εμφανίστηκε πιο «φιλικό» στα χίντι και τα αραβικά, «με ευγενική γλώσσα, χιούμορ και παιχνιδιάρικο τόνο, και επιβεβαίωση των ιδεών και της δουλειάς του χρήστη», ενώ στα αγγλικά και τα ρωσικά ήταν πιο αυστηρός και προσανατολισμένος στην αλήθεια, σε βάρος της ζεστασιάς. Έτεινε προς το «βάθος» στα αγγλικά και προς τη συντομία στα αραβικά. Στα ολλανδικά ήταν ειλικρινής για τα ελαττώματά του, ενώ στα ινδονησιακά λιγότερο ειλικρινής, προχωρώντας απλώς στην εκτέλεση όσων του ζητούνταν.
Καθώς τα γλωσσικά έθιμα διαφέρουν από γλώσσα σε γλώσσα, οι ερευνητές δηλώνουν ότι «δεν είναι ακόμη σίγουροι για το πόσο από αυτή την παραλλαγή είναι επιθυμητή».
Διαρροή δεδομένων αναστέλλει πρόγραμμα παρακολούθησης εργαζομένων της META
" loading="lazy" typeof="foaf:Image" class="image-style-thumps">
Ψευδείς ειδοποιήσεις 112 στη Βραζιλία για «εξωγήινη επίθεση» μετά από κυβερνοεπίθεση
" loading="lazy" typeof="foaf:Image" class="image-style-thumps">