Danijar Hafner: AI πράκτορες που σχεδιάζουν πριν δράσουν
This AI entrepreneur is developing agents that can plan ahead for the: Ο Danijar Hafner αναπτύσσει μια νέα startup σε stealth mode.
Ο Danijar Hafner αναπτύσσει μια νέα startup σε stealth mode, με αντικείμενο AI πράκτορες που μπορούν να σχεδιάζουν τα επόμενα βήματά τους πριν βρεθούν αντιμέτωποι με το απρόβλεπτο. Το γραφείο του στο SoMa του Σαν Φρανσίσκο είναι σχεδόν άδειο, χωρίς καν το όνομα της εταιρείας στην πόρτα, όμως στο κέντρο του χώρου κρέμονται ανθρωποειδή ρομπότ διαφόρων σχημάτων και μεγεθών.
Η εικόνα ταιριάζει με το στάδιο της προσπάθειας: ο Hafner, 31 ετών, δεν αποκαλύπτει ακόμη πολλά για το νέο εγχείρημα. Περιγράφει όμως τη δουλειά ως συνέχεια της έρευνάς του πάνω σε AI συστήματα που πρέπει να κινούνται σε περιβάλλοντα τα οποία δεν είχαν συναντήσει κατά την εκπαίδευσή τους. Το μοναδικό συγκεκριμένο στοιχείο για την εταιρεία είναι ότι παραμένει σε stealth mode και δεν έχει ακόμη όνομα στην είσοδο.
Η βασική τεχνική ονομάζεται model-based reinforcement learning. Ο Hafner δημιουργεί world models, δηλαδή μοντέλα AI που μιμούνται τη φυσική πραγματικότητα, και εκπαιδεύει μέσα σε αυτά τους πράκτορες. Ο πράκτορας αντιμετωπίζει το μοντέλο σαν προσομοίωση του πραγματικού κόσμου, μαθαίνει ποιες ενέργειες έχουν νόημα και χρησιμοποιεί αυτή την εμπειρία για να προβλέψει πιθανά αποτελέσματα πριν δράσει.
Διαβάστε επίσης: Tiny Engineer: 3D εκτυπώσιμο ρομπότ για AI agents
Η διαφορά φαίνεται όταν το περιβάλλον αλλάζει. Ένα ρομπότ που προορίζεται για ανθρώπινο σπίτι δεν αρκεί να γνωρίζει έναν συγκεκριμένο χώρο· πρέπει να μπορεί να αντιδράσει σε άγνωστη κάτοψη, έπιπλα και απρόσμενες καταστάσεις. Σύμφωνα με την περιγραφή της προσέγγισης, οι πράκτορες μπορούν να μεταφέρουν αυτές τις προβλέψεις σε νέες συνθήκες, αντί να βασίζονται αποκλειστικά σε δοκιμές και λάθη μέσα στον πραγματικό κόσμο.
Η μέθοδος έχει δοκιμαστεί αρχικά σε εικονικά περιβάλλοντα. Το PlaNet ήταν το πρώτο μεγάλο βήμα, επιτρέποντας σε πράκτορες να εκτελούν ενέργειες σχεδιάζοντας μπροστά. Ακολούθησε το Dreamer 2, που πέτυχε επίδοση ανθρώπινου επιπέδου σε παιχνίδια Atari 2600 χρησιμοποιώντας world model, ενώ το Dreamer 3 έλυσε την πρόκληση εξόρυξης διαμαντιών στο Minecraft.
Το Dreamer 4 προχώρησε ακόμη περισσότερο: έμαθε να εξορύσσει διαμάντια από offline σύνολο καταγεγραμμένων βίντεο παιχνιδιού, χωρίς άμεση αλληλεπίδραση με το ίδιο το παιχνίδι. Αυτή η πορεία εξηγεί γιατί τα ανθρωποειδή στο γραφείο δεν είναι απλώς εντυπωσιακό σκηνικό. Αποτελούν τη φυσική συνέχεια ενός ερευνητικού μοντέλου που ξεκίνησε από την πρόβλεψη ενεργειών σε προσομοιώσεις.
Πιο πρόσφατα, ο Hafner μετέφερε την ιδέα από τον ψηφιακό στον φυσικό κόσμο μέσω του DayDreamer. Το project επέτρεψε σε ρομπότ να λειτουργούν σε νέα περιβάλλοντα και να αντιδρούν σε εμπειρίες όπως το να τα σπρώξουν, χωρίς να έχει δοθεί ειδική εκπαίδευση για κάθε περιστατικό. Το ενδιαφέρον σημείο είναι ότι η προσαρμογή επιχειρείται πριν απαιτηθεί μια ατελείωτη συλλογή πραγματικών δοκιμών.
Η startup δεν έχει ακόμη ανακοινώσει όνομα ή λεπτομέρειες για το προϊόν της, επομένως η κατεύθυνση είναι πιο ξεκάθαρη από το τελικό σχέδιο. Προς το παρόν, το βέβαιο είναι ότι ο Hafner μεταφέρει την έρευνα των world models και των πρακτόρων που σχεδιάζουν εκ των προτέρων σε ρομπότ με στόχο να αντιμετωπίζουν καταστάσεις που δεν υπήρχαν στα δεδομένα εκπαίδευσης. Το επόμενο κρίσιμο βήμα θα είναι να φανεί πώς αυτή η ιδέα λειτουργεί σε πραγματικές, απρόβλεπτες συνθήκες.
Η σύνταξη του άρθρου υποστηρίχθηκε από εργαλεία AI και το περιεχόμενο ελέγχθηκε σύμφωνα με τη συντακτική πολιτική του TechitNews.