Ρώσοι μαθηματικοί έβαλαν AI μοντέλα να επικοινωνούν με κάτι που μοιάζει σαν τηλεπάθεια
ΙΩΑΝΝΑ ΚΑΡΔΟΥΛΙΑ
Ρώσοι μαθηματικοί έβαλαν κάποια μοντέλα AI να επικοινωνούν μεταξύ τους. Όχι με τρόπο που το έκαναν μέχρι πρότινος, αλλά με κάτι που μοιάζει με «τηλεπάθεια μηχανών».
Να εξηγήσουμε.
Οι συγκεκριμένοι μαθηματικοί εργάζονται για μια startup που ονομάζεται Mostik, που στα ρωσικά σημαίνει «γέφυρα». Το όνομα δεν είναι τυχαίο, αφού η προσέγγισή τους επιτρέπει σε διαφορετικά μοντέλα τεχνητής νοημοσύνης να αλληλεπιδρούν μεταξύ τους, χρησιμοποιώντας τα weights τους.
Τα weights είναι οι παράμετροι βάσει των οποίων καθορίζεται ο τρόπος που ένα prompt μετατρέπεται σε αποτέλεσμα.
Αυτό πρακτικά σημαίνει ότι οι δυνατότητες ενός μεγαλύτερου μοντέλου μπορούν να μεταφερθούν σε ένα μικρότερο, ενισχύοντας την «ευφυΐα» του πολύ πιο αποτελεσματικά.
Μια διαφορετική προσέγγιση για την εξέλιξη του AI
Η startup χρησιμοποίησε αυτή την προσέγγιση για να δημιουργήσει ένα μοντέλο που εκτοξεύτηκε στην κορυφή του ARC-AGI 3, ενός διαγωνισμού για μοντέλα τεχνητής νοημοσύνης που θεωρείται εξαιρετικά δύσκολος.
Για να εκθέσουν τον τρόπο που λειτουργεί η ιδέα τους, δημιούργησαν μια «γέφυρα» ανάμεσα σε δύο κινεζικά μοντέλα ανοιχτών weights: τη μεγαλύτερη έκδοση του GLM-5.2, η οποία διαθέτει 753 δισεκατομμύρια παραμέτρους, και μια έκδοση του Qwen-3.5 με 4 δισεκατομμύρια παραμέτρους, η οποία μπορεί να λειτουργήσει σε κινητή συσκευή.
Το υβριδικό σύστημα που προέκυψε κοστίζει το ένα εικοστό του πλήρους μοντέλου GLM, ενώ οι επιδόσεις του βρίσκονται ακριβώς στη μέση μεταξύ των δύο.
«Είναι ευρέως γνωστό στη μηχανική μάθηση ότι οι συνδυασμοί μοντέλων αποδίδουν καλύτερα από τα μεμονωμένα μοντέλα», μου είπε η Σάσα Μαλίσεβα, CEO της Mostik, μιλώντας στο WIRED.
Αν αυτή η τεχνολογία χρησιμοποιηθεί ευρέως, θα μπορούσε να αυξήσει την αξία των μοντέλων ανοιχτών weights, επιτρέποντάς τους να ανταγωνιστούν αποτελεσματικότερα τα κλειστά, ιδιόκτητα μοντέλα που προσφέρουν κορυφαία εργαστήρια τεχνητής νοημοσύνης, όπως η Anthropic και η OpenAI.
Η CEO της εταιρείας, υποστηρίζει ότι ο συνδυασμός πολλών διαφορετικών μοντέλων μπορεί τελικά να αποδειχθεί καλύτερος τρόπος για την εξέλιξη της τεχνητής νοημοσύνης. «Προσωπικά δεν πιστεύω ότι στο μέλλον θα έχουμε ένα μονολιθικό μοντέλο ή ότι οι δυνατότητες των μοντέλων θα προκύπτουν από το scaling», είπε, αναφερόμενη στη στρατηγική της δημιουργίας ολοένα μεγαλύτερων μοντέλων και της τροφοδότησής τους με περισσότερα δεδομένα.
Κάτι που «θα χρειαζόταν χρόνια για να επιτευχθεί»
«Αν η Mostik καταστήσει δυνατή τη σύνδεση κορυφαίων μοντέλων με μοντέλα εξειδικευμένα σε συγκεκριμένους τομείς -για παράδειγμα στη βιολογία, τη φυσική και ούτω καθεξής- τότε θα μπορούσαν να εκπαιδευτούν πολύ περισσότερα εξειδικευμένα μοντέλα», λέει ο Βλαντίμιρ Αρουσταμανιάν, τεχνικός επικεφαλής της εταιρείας λογισμικού τεχνητής νοημοσύνης Lovable, ο οποίος γνωρίζει την ομάδα της Mostik. «Αυτή η ομάδα ασχολείται με αυτό εδώ και μόλις λίγους μήνες και ήδη έχει κάτι σε λειτουργία που θα υπέθετα ότι θα χρειαζόταν χρόνια για να επιτευχθεί».
Η τεχνική της Mostik σημαίνει ότι «μπορείς να προσεγγίσεις την ποιότητα ενός μεγάλου μοντέλου χωρίς το μεγάλο μοντέλο να χρειάζεται να διαχειρίζεται ολόκληρη τη διαδικασία, επιτυγχάνοντας σημαντικές βελτιώσεις απλώς με ένα μικρότερο μοντέλο να λειτουργεί παράλληλα», λέει ο Καρλ Τιλς, πρώην επιστήμονας υπολογιστών της Google DeepMind, ο οποίος γνωρίζει την τεχνολογία της εταιρείας.
Ο Στανισλάβ Σμιρνόφ, καθηγητής στο Πανεπιστήμιο της Γενεύης και κάτοχος του Μεταλλίου Fields του 2010, είναι ο επικεφαλής επιστήμονας της Mostik. Όπως λέει, το να βρεθεί κοινό έδαφος ανάμεσα σε δύο μοντέλα τεχνητής νοημοσύνης είναι εκπληκτικά δύσκολο.
«Φαίνεται πως δεν υπάρχει ακόμη η κατάλληλη μαθηματική γλώσσα», λέει. Στο μεταξύ, η προσέγγιση της Mostik αποτελεί έναν τρόπο να «γεφυρωθεί» κυριολεκτικά αυτό το χάσμα.
Πηγή: rosa.gr