Meta-Harness: ασφαλέστερες αυτοβελτιούμενες εταιρικές ροές εργασίας AI

Ένας πειθαρχημένος μετα-μηχανισμός βοηθά τις εταιρικές ομάδες να βελτιώνουν με ασφάλεια τις ροές εργασίας πρακτόρων σε μακροχρόνιες εργασίες προγραμματισμού.

Σύνοψη για στελέχη

  • Τα υπάρχοντα συστήματα αυτόνομης βελτίωσης έχουν επιδείξει ισχυρά αποτελέσματα σε εργασίες προγραμματισμού, αλλά παραμένει ασαφές αν μπορούν να βελτιώσουν σύνθετες, μακροχρόνιες ροές εργασίας AI που μοιάζουν με πραγματικές εταιρικές υλοποιήσεις.

  • Η έρευνά μας για το Meta-Harness εφαρμόζει αυτόνομη αυτοβελτίωση σε ροές ανάκτησης με πράκτορες, έρευνας σε βάθος και πληροφοριών σημάτων, προσθέτοντας παράλληλα εταιρικές απαιτήσεις όπως αξιολόγηση σε αποκλεισμένα δεδομένα, δυνατότητα ελέγχου, έλεγχοι προϋπολογισμού και ανθρώπινη έγκριση.

  • Σε τρεις αντιπροσωπευτικούς φόρτους εργασίας, το Meta-Harness βελτίωσε σημαντικά την απόδοση, μεταξύ άλλων με βελτίωση 84% στην απόδοση δοκιμών με αποκλεισμένα δεδομένα για το Signal Engine και υψηλότερη ακρίβεια με 16× ταχύτερη εκτέλεση για την Πολυτροπική Ανάκτηση με Πράκτορες.

  • Σε αντίθεση με τις περισσότερες προηγούμενες προσεγγίσεις, το Meta-Harness μετρά, όπου είναι δυνατόν, την επιτυχία σε αποκλεισμένα σύνολα δεδομένων, ώστε να αξιολογείται κατά πόσο οι βελτιώσεις γενικεύονται πέρα από τα δεδομένα που χρησιμοποιήθηκαν κατά τη βελτιστοποίηση.

  • Τα αποτελέσματα αυτά υποδεικνύουν ότι η αυτόνομη βελτίωση ροών εργασίας μπορεί να επεκταθεί πέρα από τα σημεία αναφοράς προγραμματισμού σε πραγματικά εταιρικά συστήματα AI, προσφέροντας μια πρακτική οδό για εφαρμογές AI που βελτιώνονται συνεχώς.

Πρόσφατες εργασίες για την αυτόνομη έρευνα AI, όπως η δημοσίευση Meta-Harness, το πλαίσιο CORAL και το karpathy/autoresearch, έδειξαν ότι οι πράκτορες προγραμματισμού μπορούν να βελτιώνουν επαναληπτικά μια λύση βάσει μιας μετρικής αξιολόγησης. Παραμένει ανοιχτό το κατά πόσο αυτές οι μέθοδοι εφαρμόζονται σε μακροχρόνιες ροές εργασίας AI, όπως η πολυτροπική ανάκτηση με πράκτορες, όπου ένας πράκτορας πρέπει να αναζητά επαναληπτικά σε πολυτροπικά σώματα δεδομένων ενός τομέα για να απαντήσει σε ένα ερώτημα, ή σε σύνθετες διοχετεύσεις επεξεργασίας δεδομένων που απαιτούν πολλά αλληλεξαρτώμενα βήματα, κλήσεις εργαλείων και αποφάσεις χειρισμού εξαιρέσεων. Το βαθύτερο ερώτημα είναι αν τα οφέλη διατηρούνται σε δεδομένα που ο βελτιστοποιητής δεν βλέπει ποτέ.

Η έρευνα και ανάπτυξή μας για το Meta-Harness αποτελεί την απάντησή μας σε αυτό το ερώτημα. Αξιοποιεί ιδέες από πρόσφατες έρευνες και τις προσαρμόζει στις εταιρικές ανάγκες: αξιολόγηση σε αποκλεισμένα δεδομένα, ίχνη ελέγχου, ανώτατα όρια κόστους και σαφές σημείο παράδοσης σε άνθρωπο-ελεγκτή πριν τεθεί οτιδήποτε σε παραγωγή.

Το δοκιμάσαμε σε τρεις μακροχρόνιες εργασίες, διαμορφωμένες βάσει πραγματικών έργων πελατών. Το Signal Engine παρακολουθεί μια ζωντανή ροή αναρτήσεων στο X σχετικά με την αγορά AI και παράγει δομημένες αναφορές τάσεων με αξιόπιστες πηγές. Η Πολυτροπική Ανάκτηση με Πράκτορες συλλογίζεται πάνω σε μικτά ερωτήματα κειμένου και εικόνας, ώστε να επιστρέφει τις πιο σχετικές σελίδες εγγράφων. Η Έρευνα σε Βάθος συντονίζει πολλούς πράκτορες για αναζήτηση στον ιστό, διασταύρωση πηγών και σύνταξη εκτενών ερευνητικών αναφορών.

Τα αποτελέσματα με μια ματιά

  • Signal Engine: σύνθετη βαθμολογία δοκιμής με αποκλεισμένα δεδομένα 0.456 → 0.841, σχετική αύξηση 84%. Τα CORAL και karpathy/autoresearch παρέμειναν κάτω από 0.50 με τον ίδιο προϋπολογισμό.

  • Πολυτροπική Ανάκτηση με Πράκτορες: NDCG@10 σε αποκλεισμένα δεδομένα 0.705 → 0.744, ενώ ο πραγματικός χρόνος ανά αξιολόγηση μειώθηκε από 869s σε 54s. Πρόκειται για 16× επιτάχυνση με υψηλότερη ακρίβεια.

  • Έρευνα σε Βάθος: σύνθετη βαθμολογία ποιότητας αναφοράς 0.449 → 0.802 σε 10 ερωτήσεις αναφοράς, έναντι περίπου 0.52 για τις βασικές προσεγγίσεις. Αυτή η εργασία δεν είχε σύνολο αποκλεισμένων δεδομένων, επομένως θεωρούμε ότι η τιμή αφορά μόνο το δείγμα.

  • Αποδοτικότητα αναζήτησης: με την Προγνωστική Ανακατάταξη Υποθέσεων, το Signal Engine έφτασε στο 91% της καλύτερης βαθμολογίας της εκτέλεσης αναφοράς σε 3 επαναλήψεις αντί για 20, με τον ίδιο προϋπολογισμό αξιολόγησης.

Τα περισσότερα συστήματα αυτόνομης έρευνας βελτιστοποιούν και αξιολογούν στο ίδιο σύνολο δεδομένων, καθιστώντας αδύνατο να διαπιστωθεί αν το αποτέλεσμα γενικεύεται. Για τα Signal Engine και Πολυτροπική Ανάκτηση με Πράκτορες επιβάλλουμε αυστηρό διαχωρισμό: ένα σύνολο εκπαίδευσης στο οποίο μπορούν να βαθμολογούνται οι υποψήφιες εκδόσεις, ένα σύνολο ανάπτυξης για ελέγχους ορθότητας και ένα αποκλεισμένο σύνολο δοκιμών που ο βελτιστοποιητής δεν βλέπει ποτέ. Κάθε αναφερόμενο αποτέλεσμα προέρχεται από μία συγκεκριμένη έκδοση κώδικα, βαθμολογημένη σε κάθε σύνολο, ώστε να μη συνδυάζουμε ποτέ την καλύτερη βαθμολογία εκπαίδευσης μιας υποψήφιας έκδοσης με την καλύτερη βαθμολογία δοκιμής μιας άλλης.

Πώς λειτουργεί

Σε κάθε γύρο, ο μηχανισμός δημιουργεί μια δέσμη δομημένων υποθέσεων για αλλαγές στον κώδικα. Κάθε υπόθεση προσδιορίζει τον μηχανισμό που θέλει να αλλάξει, την προηγούμενη έκδοση στην οποία βασίζεται και τον τύπο αστοχίας που στοχεύει. Ένα στάδιο κατάταξης φιλτράρει τη δέσμη πριν δαπανηθούν πόροι σε ακριβές αξιολογήσεις. Οι υποθέσεις που επιβιώνουν ανατίθενται σε παράλληλους πράκτορες εργασίας, οι οποίοι μοιράζονται μια κοινή βάση γνώσεων αλλά επεξεργάζονται τον κώδικα σε πλήρως απομονωμένους χώρους εργασίας, ώστε κάθε υποψήφια έκδοση να βαθμολογείται δίκαια και ανεξάρτητα. Στο τέλος του γύρου, το σύστημα εκτέλεσης προκρίνει έναν νικητή: την υποψήφια έκδοση με την υψηλότερη βαθμολογία που πέρασε επίσης όλους τους ελέγχους στα ορατά σύνολα δεδομένων. Αυτός ο νικητής γίνεται η βάση για τον επόμενο γύρο. Κάθε δοκιμή γράφει ένα σταθερό πακέτο σε ένα αποθετήριο τεκμηρίων αποκλειστικής προσθήκης: την ενημέρωση κώδικα, τις βαθμολογίες ανά σύνολο, ένα αρχείο καταγραφής συμβάντων και τέσσερις σύντομες αναλύσεις από LLM για το ίχνος εκτέλεσης, τα σφάλματα, το κόστος και τον αναστοχασμό. Το σύστημα υποβολής προτάσεων του επόμενου γύρου διαβάζει ξανά αυτό το ιστορικό, ώστε ο μηχανισμός να αξιοποιεί σωρευτικά όσα έμαθε, αντί να επαναλαμβάνει τα ίδια αδιέξοδα.

Διάγραμμα ροής εργασίας του Meta-Harness που παρουσιάζει εισόδους, αξιολόγηση αρχικής έκδοσης, αναζήτηση υποθέσεων, παράλληλες ομάδες πρακτόρων, χώρο εργασίας αξιολόγησης, αποτελέσματα ελέγχου, αποθετήριο τεκμηρίων και ελέγχους ασφάλειας και κόστους.

Τρεις δικλίδες ασφαλείας διασφαλίζουν την ασφαλή εκτέλεση του βρόχου. Μια πολιτική πεδίου εφαρμογής περιορίζει τα αρχεία που μπορεί να αλλάξει μια υποψήφια έκδοση και αναιρεί οτιδήποτε βρίσκεται εκτός αυτού. Τα όρια σε token και χρόνο εκτέλεσης διακόπτουν τη διαδικασία όταν η δαπάνη υπερβεί το ανώτατο όριο, ενώ τα όρια ταυτόχρονης εκτέλεσης διατηρούν τον μηχανισμό εντός των ορίων ρυθμού του μοντέλου και των GPU. Επιπλέον, ο μηχανισμός δεν θέτει ποτέ τίποτα ο ίδιος σε παραγωγή. Παράγει μια πλήρως τεκμηριωμένη και καταταγμένη υποψήφια έκδοση, ενώ ένας μηχανικός ελέγχει τις διαφορές και αποφασίζει αν θα τεθεί σε παραγωγή.

Στα ενδότερα

Σε μια τοπική στοίβα, πέντε βασικά δομικά στοιχεία μηχανικής υποστηρίζουν κάθε γύρο του παραπάνω βρόχου.

  • Απομόνωση χώρου εργασίας. Ένα git worktree ανά υποψήφια έκδοση. Οι διακλαδώσεις μοιράζονται μια βάση αντικειμένων, αλλά ποτέ τα αρχεία τους. Έτσι, οι υποψήφιες εκδόσεις εκτελούνται παράλληλα με σχεδόν σταθερό κόστος δίσκου και η σύγκρισή τους με την τρέχουσα καλύτερη έκδοση γίνεται πανεύκολη.

  • Περιβάλλον απομονωμένης εκτέλεσης. Δύο λειτουργίες μέσω ρύθμισης: εγγενής υποδιεργασία για γρήγορες επαναλήψεις ή πλήρως απομονωμένο περιβάλλον εκτέλεσης. Τα σώματα δεδομένων προσαρτώνται μόνο για ανάγνωση και ο προσωρινός κατάλογος κάθε δοκιμής διαγράφεται μετά τη βαθμολόγηση. Έτσι, μια δοκιμή δεν μπορεί να μεταβάλει το σύνολο δεδομένων ούτε να διαρρεύσει κατάσταση στην επόμενη.

  • Πολιτική πεδίου εφαρμογής. Μια λίστα επιτρεπόμενων διαδρομών, δηλωμένη στη ρύθμιση του πειράματος. Κάθε αλλαγή εκτός αυτής αναιρείται πριν βαθμολογηθεί η δοκιμή και η δοκιμή επισημαίνεται. Επομένως, οι διαφορές που βλέπει ο ελεγκτής είναι εγγυημένο ότι παραμένουν εντός του δηλωμένου πεδίου εφαρμογής.

  • Επιβολή προϋπολογισμού. Τρία επίπεδα: όρια token και χρόνου ανά δοκιμή, συνολικό ανώτατο όριο ανά εκτέλεση και όριο ταυτόχρονης εκτέλεσης. Μαζί διατηρούν τη δαπάνη προβλέψιμη και εξασφαλίζουν ότι ο μηχανισμός παραμένει εντός των ορίων ρυθμού του μοντέλου και της υποδομής.

  • Αποθετήριο τεκμηρίων. Ένα αρχείο JSONL αποκλειστικής προσθήκης με την ενημέρωση κώδικα, τις βαθμολογίες ανά σύνολο, το αρχείο συμβάντων και τις τέσσερις αναλύσεις που συντάχθηκαν από LLM. Οι υλοποιημένες προβολές (πίνακας κατάταξης, καλύτερη έκδοση, ευρετήριο αστοχιών) αναδημιουργούνται μετά από κάθε δοκιμή, επιτρέποντας στους επόμενους γύρους να αξιοποιούν το ιστορικό και διατηρώντας κάθε εκτέλεση αναπαραγώγιμη μέχρι και το τελευταίο byte.

Κανένα από αυτά τα δομικά στοιχεία δεν είναι προαιρετικό. Σκοπός του μηχανισμού είναι, στο τέλος μιας εκτέλεσης, να δίνει στον ελεγκτή κάτι που μπορεί πραγματικά να εγκρίνει: μια νικητήρια υποψήφια έκδοση, περιορισμένες διαφορές, πλήρες αρχείο όλων των δοκιμών και γνωστό κόστος. Αν αφαιρεθεί οποιοδήποτε από τα πέντε, χάνεται μία από αυτές τις εγγυήσεις.

Προγνωστική ανακατάταξη υποθέσεων

Και τα τρία πειράματα χρησιμοποιούν την ίδια στρατηγική υποθέσεων. Σε κάθε επανάληψη, το σύστημα υποβολής προτάσεων δημιουργεί περισσότερες υποθέσεις από όσες επιτρέπει ο προϋπολογισμός να εκτελεστούν: M = 8 υποψήφιες εκδόσεις για προϋπολογισμό ανάθεσης K = 4. Ένα ξεχωριστό LLM κατάταξης ταξινομεί κατόπιν και τις 8 με μία κλήση τριάντα δευτερολέπτων, έχοντας πλήρη εικόνα: την τρέχουσα καλύτερη βαθμολογία και τις αδύναμες διαστάσεις της, αναλύσεις αστοχιών από πρόσφατες δοκιμές και τις 8 προτάσεις δίπλα-δίπλα. Οι 4 κορυφαίες αποστέλλονται στο σύστημα εκτέλεσης, με κόστος 15 έως 30 λεπτά η καθεμία. Οι άλλες 4 απορρίπτονται προτού καταναλώσουν πόρους.

Αξιολογήσεις

Τα υποκείμενα μοντέλα παρέμειναν σταθερά σε όλη τη διαδικασία· ο μηχανισμός επεξεργαζόταν μόνο τον κώδικα γύρω τους. Τα Signal Engine και Έρευνα σε Βάθος εκτελέστηκαν στο gpt-5.5. Η Πολυτροπική Ανάκτηση με Πράκτορες εκτελέστηκε στο μοντέλο ανοιχτών βαρών Qwen3.6-35B-A3B, το οποίο παρεχόταν τοπικά μέσω vLLM και συνδυάστηκε με το σύστημα ανάκτησης εικόνων ColQwen3-4B. Ο συνδυασμός επιλέχθηκε για το προβλέψιμο κόστος του σε τοπική υποδομή.

Το παρακάτω γράφημα δείχνει πώς μεταβλήθηκαν οι βαθμολογίες στις τρεις κύριες εργασίες μας. «Αρχική έκδοση» είναι ο αρχικός κώδικας που γράφτηκε από άνθρωπο μηχανικό. «Meta-Harness» είναι η καλύτερη έκδοση που εντόπισε το Meta-Harness. Παρατηρούμε βελτίωση της απόδοσης και στις τρεις εργασίες στο αποκλεισμένο σύνολο δοκιμών.

Ραβδόγραμμα σύγκρισης της απόδοσης της αρχικής έκδοσης και του Meta-Harness στα Signal Engine, Πολυτροπική Ανάκτηση με Πράκτορες και Έρευνα σε Βάθος, με το Meta-Harness να υπερέχει σε όλες τις δοκιμές με αποκλεισμένα δεδομένα.

Το Signal Engine αξιολογήθηκε από κριτή LLM ως προς την επικαιρότητα, την ακρίβεια των γεγονότων, το επίπεδο λεπτομέρειας και τον τόνο, με 150 αναρτήσεις εκπαίδευσης και 150 αποκλεισμένες αναρτήσεις δοκιμής από το X. Κατά την εκτέλεση, η καλύτερη έκδοση αύξησε τη σύνθετη βαθμολογία εκπαίδευσης από 0.431 σε 0.756 και τη βαθμολογία στα αποκλεισμένα δεδομένα από 0.456 σε 0.841. Τα οφέλη προήλθαν από αλλαγές στον ίδιο τον μηχανισμό και όχι μόνο από προσαρμογές της προτροπής: οι νικητήριες επαναλήψεις έμαθαν να φιλτράρουν τον θόρυβο των μέσων κοινωνικής δικτύωσης, πρόσθεσαν βήματα διασταύρωσης γεγονότων και απαίτησαν κάθε αποτέλεσμα να τεκμηριώνεται με ρητά αποδεικτικά στοιχεία. Το παρακάτω διάγραμμα παρουσιάζει τη διαδικασία επανάληψης.

Γραμμικό γράφημα των δοκιμών εκπαίδευσης του Signal Engine, όπου η καλύτερη τρέχουσα βαθμολογία και οι βαθμολογίες στα αποκλεισμένα δεδομένα βελτιώνονται από την αρχική τιμή προς τον στόχο, μέσα από διαδοχικές προσπάθειες εξερεύνησης και βελτίωσης.

Το ιστορικό δοκιμών δείχνει πώς συσσωρεύτηκαν αυτά τα οφέλη. Μια πρώιμη δομική αλλαγή αύξησε την καλύτερη τρέχουσα βαθμολογία σε 0.625· η λεπτομερέστερη διαχείριση τεκμηρίων την ώθησε σε 0.679· και ένας βελτιωμένος βρόχος αναστοχασμού και κριτηρίων την ανέβασε σε 0.819. Περίπου οι μισές εκτελέσεις υποψήφιων εκδόσεων είχαν χαμηλότερη απόδοση ή απέτυχαν εντελώς, αλλά δεν επηρέασαν τον πίνακα κατάταξης: κάθε διακλάδωση εκτελούνταν απομονωμένα, οι ανεπιτυχείς διαφορές απορρίπτονταν και οι αστοχίες καταγράφονταν στο αποθετήριο αναστοχασμού, ώστε το επόμενο σύστημα υποβολής προτάσεων να μην επαναλάβει το ίδιο αδιέξοδο.

Το σημαντικότερο είναι ότι η καμπύλη των αποκλεισμένων δεδομένων ανέβαινε μαζί με την καμπύλη εκπαίδευσης σε όλη την εκτέλεση. Αυτό υποδεικνύει ότι ο μηχανισμός βελτίωνε τη ροή εργασίας αντί να απομνημονεύει το σώμα δεδομένων εκπαίδευσης. Οι βαθμολογίες στα αποκλεισμένα δεδομένα ήταν ελαφρώς υψηλότερες από τις βαθμολογίες εκπαίδευσης, κάτι που αποδίδουμε στον συνήθη δειγματοληπτικό θόρυβο μεταξύ δύο μικρών, διακριτών συνόλων.

Η Πολυτροπική Ανάκτηση με Πράκτορες μετριέται με NDCG@10 στο δημόσιο σύνολο Computer Science του ViDoRe V3, το οποίο επιμελήθηκε σε 20 ερωτήματα εκπαίδευσης, 10 ανάπτυξης και 20 αποκλεισμένα ερωτήματα δοκιμής. Ο μηχανισμός αύξησε το NDCG@10 στα αποκλεισμένα δεδομένα από 0.705 σε 0.744, ενώ μείωσε τον συνολικό πραγματικό χρόνο αξιολόγησης από 869 δευτερόλεπτα σε 54 δευτερόλεπτα.

Η Έρευνα σε Βάθος βαθμολογείται σε μια σύνθετη μετρική ουσιαστικής ποιότητας και ποιότητας παραπομπών, με κριτή LLM, ακολουθώντας το DeepResearch-Eval, σε 10 ερωτήσεις αναφοράς. Ο βελτιωμένος κώδικας αύξησε τον μέσο όρο από 0.449 σε 0.802. Οι νικητήριες αλλαγές διακρίνονταν εύκολα στις διαφορές: ένα αρχικό στάδιο σχεδιασμού που συγκρίνει προσεγγίσεις πριν ανατεθεί εργασία σε πράκτορες έρευνας και ένα τελικό στάδιο ελέγχου που στοχεύει στις διαστάσεις όπου οι αναφορές είχαν ιστορικά χαμηλή βαθμολογία. Επειδή αυτό το σύνολο είναι μικρό και ακριβό στην αξιολόγηση, δεν το διαχωρίσαμε και θεωρούμε ότι το αποτέλεσμα αφορά το ίδιο το δείγμα.

Σύγκριση με τα CORAL και karpathy/autoresearch

Ραβδογράμματα που συγκρίνουν τα Meta-Harness, CORAL και karpathy/autoresearch ως προς τις βαθμολογίες των Signal Engine, Πολυτροπικής Ανάκτησης με Πράκτορες και Έρευνας σε Βάθος, καθώς και την καθυστέρηση αξιολόγησης.

Αξιολογήσαμε συγκριτικά και τις τρεις μεθόδους με τον ίδιο προϋπολογισμό: ίδια σύνολα δεδομένων, ίδια υποκείμενα μοντέλα, ίδιο όριο επαναλήψεων και ίδιο συνολικό πλήθος αξιολογήσεων υποψήφιων εκδόσεων. Στο Signal Engine, το Meta-Harness φτάνει το 0.841 στη δοκιμή με αποκλεισμένα δεδομένα, ενώ και οι δύο βασικές προσεγγίσεις παρέμειναν κάτω από 0.50. Στην Πολυτροπική Ανάκτηση με Πράκτορες, η ομάδα μας πετυχαίνει το υψηλότερο NDCG@10 στα αποκλεισμένα δεδομένα (0.744, έναντι 0.700 για το CORAL και 0.738 για το karpathy) και εκτελεί την επίσημη αξιολόγηση δώδεκα έως δεκατέσσερις φορές ταχύτερα: 54s έναντι 786s και 650s. Στην Έρευνα σε Βάθος, η ομάδα μας φτάνει το 0.802, ενώ και οι δύο βασικές προσεγγίσεις παρέμειναν κοντά στο 0.52. Ισχύει μία επιφύλαξη για όλα τα αποτελέσματα: υλοποιήσαμε εκ νέου τα CORAL και karpathy/autoresearch βάσει των δημοσιευμένων περιγραφών τους, επομένως μέρος της διαφοράς μπορεί να οφείλεται σε διαφορές υλοποίησης και όχι μόνο μεθόδου.

Τέσσερις σχεδιαστικές επιλογές εξηγούν τη διαφορά. Πρώτον, η ομάδα μας δημιουργεί μια δομημένη προδιαγραφή σχεδιασμού πριν γίνει οποιαδήποτε επεξεργασία κώδικα, γεγονός που την κατευθύνει προς δομικές αλλαγές, όπως νέα στάδια διοχέτευσης, αντί για προσαρμογές της προτροπής. Δεύτερον, εκτελεί ταυτόχρονες διακλαδώσεις που βασίζονται σε μια κοινή καλύτερη υποψήφια έκδοση, ώστε οι βελτιώσεις να συσσωρεύονται ταχύτερα απ’ ό,τι με τους ανεξάρτητους πράκτορες του CORAL ή τον αυστηρά διαδοχικό βρόχο του karpathy. Τρίτον, κάθε δοκιμή αφήνει δομημένα τεχνουργήματα (βαθμολογίες, αρχεία συμβάντων και τέσσερις αναλύσεις από LLM), τα οποία διαβάζει το επόμενο σύστημα υποβολής προτάσεων, ενώ οι βασικές προσεγγίσεις διατηρούν μόνο απλά αρχεία καταγραφής προσπαθειών. Τέταρτον, ένας προσαρμοστικός ελεγκτής κατευθύνει το σύστημα υποβολής προτάσεων προς την εξερεύνηση μετά από στασιμότητα και προς τη βελτίωση μετά από επιτυχία, ενώ η Προγνωστική Ανακατάταξη Υποθέσεων απορρίπτει τις αδύναμες ιδέες πριν καταναλώσουν προϋπολογισμό.

Τι δεν έχουμε αποδείξει

Οι καμπύλες των αποκλεισμένων δεδομένων καταδεικνύουν γενίκευση εντός του ίδιου τομέα και όχι μεταφορά μεταξύ τομέων: μια ροή εργασίας ρυθμισμένη για εξαγωγή σημάτων από την αγορά AI δεν αναμένεται να αποδώσει εξίσου σε νομικά ή βιοϊατρικά κείμενα χωρίς νέα εκτέλεση του μηχανισμού. Ο μηχανισμός βελτιστοποιεί επίσης μόνο ό,τι ορίζει ο βαθμολογητής. Έτσι, ένα θορυβώδες σύνολο εκπαίδευσης ή ένας κακώς βαθμονομημένος κριτής θα οδηγήσει με συνέπεια σε υπερπροσαρμογή· συνιστούμε τουλάχιστον 20 προσεκτικά επιμελημένα στοιχεία εκπαίδευσης και ξεχωριστό σύνολο ανάπτυξης πριν από μια σοβαρή εκτέλεση. Το κόστος είναι ο μεγαλύτερος πρακτικός περιορισμός. Κάθε αξιολόγηση επανεκτελεί ολόκληρη τη διοχέτευση σε όλα τα σύνολα, η επιλεγμένη υποψήφια έκδοση ανάκτησης κατανάλωσε από μόνη της περίπου 2,2 εκατομμύρια token εισόδου και μια σοβαρή βελτιστοποίηση σε μοντέλο κατηγορίας gpt-5.5 κοστίζει από μερικές εκατοντάδες έως λίγο πάνω από χίλια δολάρια ανά εργασία. Τέλος, αυτοί οι αριθμοί προέρχονται από μεμονωμένες εκτελέσεις και όχι από επαναλαμβανόμενες δοκιμές. Γι’ αυτό τους κοινοποιούμε ως τεχνική ανάρτηση ιστολογίου και όχι ως επίσημη μελέτη.

Συμπέρασμα

Το Meta-Harness δείχνει ότι η αυτόνομη βελτίωση κώδικα μπορεί να γίνει αρκετά πειθαρχημένη για εταιρική χρήση. Τα απαραίτητα συστατικά είναι οι δομικές υποθέσεις, το προγνωστικό προφιλτράρισμα, η απομονωμένη αξιολόγηση, οι δοκιμές με αποκλεισμένα δεδομένα όπου το επιτρέπουν τα δεδομένα και ένα πλήρες ίχνος ελέγχου για κάθε αλλαγή που προκρίνεται. Μαζί, προσφέρουν σε μια ομάδα μηχανικών μια προβλέψιμη διαδρομή από μια λειτουργική αρχική διοχέτευση σε μια μετρήσιμα καλύτερη και παρέχουν στον υπεύθυνο λειτουργίας ένα απλό μοντέλο: τα οφέλη της αυτόνομης εξερεύνησης μέσα σε ένα αυστηρό πλαίσιο που λαμβάνει υπόψη τον προϋπολογισμό, με άνθρωπο στη διαδικασία πριν τεθεί οτιδήποτε σε παραγωγή.

Συγγραφείς

David Huang, Bjorn Jee