Uelekezaji mkuu

Meta-Harness: mitiririko salama ya AI ya biashara inayojiboresha

Meta-Harness thabiti husaidia timu za biashara kuboresha kwa usalama mitiririko ya mawakala katika kazi za muda mrefu za usimbaji.

Muhtasari wa kiutendaji

  • Mifumo iliyopo ya uboreshaji huru imeonyesha matokeo mazuri katika kazi za usimbaji, lakini bado haijulikani ikiwa inaweza kuboresha mitiririko changamano ya AI ya muda mrefu inayofanana na utekelezaji halisi wa biashara.

  • Utafiti wetu wa Meta-Harness unatumia uboreshaji huru wa kujiboresha katika urejeshaji wa kiwakala, utafiti wa kina na mitiririko ya taarifa za kiintelijensia, huku ukiongeza mahitaji ya biashara kama tathmini iliyotengwa, uwezo wa kukaguliwa, udhibiti wa bajeti na idhini ya binadamu.

  • Katika kazi tatu wakilishi, Meta-Harness iliboresha utendaji kwa kiasi kikubwa, ikiwemo uboreshaji wa 84% katika utendaji wa jaribio lililotengwa kwa Signal Engine na usahihi wa juu pamoja na utekelezaji wa kasi mara 16 kwa Urejeshaji wa Midia Nyingi wa Kiwakala.

  • Tofauti na mbinu nyingi za awali, Meta-Harness hupima mafanikio kwenye mikusanyiko ya data iliyotengwa inapowezekana ili kutathmini kama maboresho yanafanya kazi kwa data nyingine zaidi ya iliyotumika wakati wa uboreshaji.

  • Matokeo haya yanaonyesha kuwa uboreshaji huru wa mtiririko wa kazi unaweza kuvuka vigezo vya usimbaji na kutumika katika mifumo halisi ya AI ya biashara, na kutoa njia ya vitendo ya kuboresha programu za AI kila wakati.

Kazi za hivi karibuni kuhusu utafiti huru wa AI, zikiwemo makala ya Meta-Harness, mfumo wa CORAL na karpathy/autoresearch, zimeonyesha kuwa mawakala wa usimbaji wanaweza kuboresha suluhisho kwa hatua wakiongozwa na kipimo cha tathmini. Jambo ambalo bado halijathibitishwa ni kama mbinu hizo zinafaa kwa mitiririko ya muda mrefu ya AI, kama urejeshaji wa midia nyingi wa kiwakala ambapo wakala lazima atafute mara kwa mara katika mikusanyiko ya kikoa yenye midia mbalimbali ili kujibu swali, au mifumo changamano ya kuchakata data inayohitaji hatua nyingi tegemezi, miito ya zana na maamuzi ya kushughulikia hitilafu. Swali la kina zaidi ni kama mafanikio hayo yanadumu kwenye data ambayo kiboreshaji hakijawahi kuona.

Utafiti na uundaji wetu wa Meta-Harness ndio jibu letu kwa swali hilo. Huchukua mawazo kutoka utafiti wa hivi karibuni na kuyarekebisha kulingana na mahitaji ya biashara: tathmini iliyotengwa, rekodi za ukaguzi, vikomo vya gharama na hatua wazi ya kukabidhi kazi kwa mkaguzi binadamu kabla ya chochote kusafirishwa.

Tuliijaribu katika kazi tatu za muda mrefu zilizoundwa kulingana na kazi halisi za wateja. Signal Engine hufuatilia mtiririko wa moja kwa moja wa machapisho ya X kuhusu soko la AI na kutoa ripoti za mitindo zilizopangwa na kuungwa mkono vizuri na vyanzo. Urejeshaji wa Midia Nyingi wa Kiwakala huchanganua hoja zenye maandishi na picha ili kurudisha kurasa za hati zinazofaa zaidi. Utafiti wa Kina huratibu mawakala wengi kutafuta kwenye wavuti, kuhakiki vyanzo na kuandika ripoti ndefu za utafiti.

Muhtasari wa matokeo

  • Signal Engine: kipimo mseto cha jaribio lililotengwa 0.456 → 0.841, ongezeko linganifu la 84%. CORAL na karpathy/autoresearch zilibaki chini ya 0.50 kwa bajeti ileile.

  • Urejeshaji wa Midia Nyingi wa Kiwakala: NDCG@10 iliyotengwa 0.705 → 0.744, huku muda halisi kwa kila tathmini ukipungua kutoka sekunde 869 hadi 54. Hiyo ni kasi ya mara 16 pamoja na usahihi wa juu.

  • Utafiti wa Kina: kipimo mseto cha ubora wa ripoti 0.449 → 0.802 katika maswali 10 ya marejeleo, dhidi ya takriban 0.52 kwa mbinu za msingi. Kazi hii haikuwa na mgawanyo uliotengwa, kwa hivyo tunachukulia alama hiyo kuwa ya sampuli iliyotumika pekee.

  • Ufanisi wa utafutaji: kwa kutumia Upangaji Upya Tabiri wa Nadharia Tete, Signal Engine ilifikia 91% ya alama bora ya uendeshaji wa marejeleo kwa marudio 3 badala ya 20 kwa bajeti ileile ya tathmini.

Mifumo mingi ya utafiti huru huboresha na kutathmini kwa mkusanyiko uleule wa data, hivyo haiwezekani kujua ikiwa matokeo yatafanya kazi kwa data nyingine. Kwa Signal Engine na Urejeshaji wa Midia Nyingi wa Kiwakala, tunatekeleza mgawanyo mkali: seti ya mafunzo ambayo mapendekezo yanaweza kupimiwa, seti ya ukuzaji kwa ukaguzi wa msingi na seti ya jaribio iliyotengwa ambayo kiboreshaji hakioni kamwe. Kila matokeo yaliyoripotiwa hutokana na toleo moja mahususi la msimbo lililopimwa kwenye kila mgawanyo, kwa hivyo hatuchanganyi kamwe alama bora ya mafunzo ya pendekezo moja na alama bora ya jaribio ya pendekezo jingine.

Jinsi inavyofanya kazi

Katika kila awamu, mazingira ya uendeshaji huzalisha kundi la nadharia tete zilizopangwa kuhusu mabadiliko ya msimbo. Kila nadharia tete hutaja utaratibu inaotaka kubadilisha, toleo la awali inaloendeleza na aina ya hitilafu inayolenga. Hatua ya kupanga kwa ubora huchuja kundi hilo kabla ya kutumia rasilimali kwa tathmini zozote ghali. Nadharia tete zinazopita hupelekwa kwa mawakala watendaji sambamba wanaotumia hazina moja ya maarifa lakini huhariri msimbo katika eneokazi yaliyotengwa kabisa, ili kila pendekezo litathminiwe kwa haki na kujitegemea. Mwishoni mwa awamu, kiendeshaji huteua mshindi mmoja: pendekezo lenye alama ya juu zaidi ambalo pia limepita kila ukaguzi kwenye migawanyo inayoonekana. Mshindi huyo huwa toleo bora linaloendelezwa katika awamu inayofuata. Kila jaribio huandika kifurushi kisichobadilika katika hifadhi ya ushahidi inayoruhusu nyongeza pekee: kiraka cha msimbo, alama za kila mgawanyo, kumbukumbu ya matukio na uchanganuzi mfupi minne iliyoandikwa na LLM kuhusu mfuatano, hitilafu, gharama na tafakari yake. Mpendekezaji wa awamu inayofuata husoma historia hii, na hivyo mazingira ya uendeshaji hujenga juu ya maarifa yaliyopatikana badala ya kurudia njia zilezile zisizofaa.

Mchoro wa mtiririko wa kazi wa Meta-Harness unaoonyesha ingizo, tathmini ya seed, utafutaji wa nadharia tete, timu sambamba za mawakala, eneokazi la tathmini, matokeo ya ukaguzi, hifadhi ya ushahidi na vidhibiti vya usalama na gharama.

Miongozo mitatu ya ulinzi huhakikisha mzunguko unaendeshwa kwa usalama. Sera ya upeo huweka mipaka ya faili ambazo pendekezo linaweza kugusa na kutengua mabadiliko yoyote nje ya upeo huo. Bajeti za tokeni na muda halisi husimamisha uendeshaji gharama inapovuka kikomo, huku vikomo vya uendeshaji sambamba vikiweka mazingira ya uendeshaji ndani ya viwango vinavyoruhusiwa vya muundo na GPU. Na mazingira ya uendeshaji hayasafirishi chochote yenyewe. Hutoa pendekezo lililopangwa kwa ubora na kurekodiwa kikamilifu, kisha mhandisi binadamu hukagua tofauti na kuamua kama lipelekwe uzalishaji.

Teknolojia ya ndani

Katika mfumo wa ndani, vipengele vitano vya msingi vya uhandisi hutegemeza kila awamu ya mzunguko ulioelezwa hapo juu.

  • Utengaji wa Eneokazi. Git worktree moja kwa kila pendekezo. Nakala hutumia hifadhidata moja ya vipengee lakini hazishiriki faili, hivyo mapendekezo yanaweza kuendeshwa sambamba kwa gharama ya diski isiyobadilika sana na ni rahisi kulinganisha tofauti zake na toleo bora la sasa.

  • Sandbox ya Utekelezaji. Ina hali mbili zinazowekwa kupitia usanidi: mchakato mdogo asilia kwa marudio ya haraka au mazingira ya utekelezaji yaliyotengwa kabisa. Mikusanyiko ya data huunganishwa katika hali ya kusoma pekee, na saraka ya muda ya kila jaribio hufutwa baada ya kutathminiwa. Kwa hiyo, jaribio haliwezi kubadilisha mkusanyiko wa data wala kuvuja hali yake hadi jaribio linalofuata.

  • Sera ya Upeo. Orodha ya njia zinazoruhusiwa iliyobainishwa katika usanidi wa jaribio. Chochote kinachoguswa nje yake hurejeshwa kabla ya jaribio kutathminiwa, na jaribio hilo huwekewa alama. Kwa hivyo, tofauti anayoona mkaguzi imehakikishwa kubaki ndani ya upeo uliobainishwa.

  • Utekelezaji wa Bajeti. Tabaka tatu: vikomo vya tokeni na muda halisi kwa kila jaribio, kikomo cha jumla kwa kila uendeshaji na kikomo cha uendeshaji sambamba. Kwa pamoja, hufanya matumizi yatabirike na kuhakikisha mazingira ya uendeshaji yanazingatia viwango vinavyoruhusiwa vya muundo na miundombinu.

  • Hifadhi ya Ushahidi. JSONL inayoruhusu nyongeza pekee yenye kiraka cha msimbo, alama za kila mgawanyo, kumbukumbu ya matukio na uchanganuzi minne iliyoandikwa na LLM. Mionekano iliyotayarishwa (jedwali la viongozi, toleo bora la sasa na faharasa ya hitilafu) huzalishwa upya baada ya kila jaribio, hivyo awamu zinazofuata zinaweza kuendeleza historia huku kila uendeshaji ukiweza kurudiwa sawa kwa kila baiti.

Hakuna kipengele chochote kati ya hivi ambacho ni cha hiari. Lengo la mazingira ya uendeshaji ni kumpa mkaguzi kitu anachoweza kuidhinisha mwishoni mwa uendeshaji: pendekezo lililoshinda, tofauti yenye mipaka, rekodi kamili ya yote yaliyojaribiwa na gharama inayojulikana. Ukiondoa kimojawapo kati ya vipengele hivyo vitano, mojawapo ya hakikisho hizo hutoweka.

Upangaji upya tabiri wa nadharia tete

Majaribio yote matatu hutumia mkakati uleule wa nadharia tete. Katika kila marudio, mpendekezaji huzalisha nadharia tete nyingi kuliko bajeti inavyoweza kuendesha: M = mapendekezo 8 kwa bajeti ya kutuma ya K = 4. Kisha LLM tofauti ya kupanga kwa ubora hupanga zote 8 katika mwito mmoja wa sekunde thelathini, ikiwa na picha kamili: alama bora ya sasa na vipengele vyake dhaifu, uchanganuzi wa hitilafu za majaribio ya hivi karibuni na mapendekezo yote 8 yakilinganishwa. Mapendekezo 4 bora hupelekwa kwa kitekelezaji kwa gharama ya dakika 15 hadi 30 kila moja. Mengine 4 huondolewa kabla hayajatumia chochote.

Tathmini

Miundo ya msingi haikubadilishwa wakati wote; mazingira ya uendeshaji yalihariri tu msimbo unaoizunguka. Signal Engine na Utafiti wa Kina ziliendeshwa kwenye gpt-5.5. Urejeshaji wa Midia Nyingi wa Kiwakala uliendeshwa kwenye Qwen3.6-35B-A3B yenye uzani wazi, iliyotolewa ndani kupitia vLLM, pamoja na kirejeshaji picha cha ColQwen3-4B; mchanganyiko huu ulichaguliwa kwa gharama ya ndani inayotabirika.

Chati iliyo hapa chini inaonyesha jinsi alama za kazi zetu tatu kuu zilivyobadilika. "Seed" ni msimbo wa kuanzia ulioandikwa na mhandisi binadamu. "Meta-Harness" ni toleo bora zaidi lililopatikana na Meta-Harness. Tunaona utendaji ukiimarika kwa kazi zote tatu katika seti ya jaribio iliyotengwa.

Chati ya pau inayolinganisha utendaji wa seed na Meta-Harness kwenye Signal Engine, Urejeshaji wa Midia Nyingi wa Kiwakala na Utafiti wa Kina, huku Meta-Harness ikiongoza katika majaribio yote yaliyotengwa.

Signal Engine ilitathminiwa na mwamuzi wa LLM kwa kuzingatia upya wa taarifa, usahihi wa ukweli, kiwango cha maelezo na toni, kwa kutumia tweet 150 za mafunzo na tweet 150 za jaribio lililotengwa. Wakati wa uendeshaji, toleo bora liliboresha kipimo mseto cha mafunzo kutoka 0.431 hadi 0.756 na alama iliyotengwa kutoka 0.456 hadi 0.841. Mafanikio yalitokana na mabadiliko ya mazingira yenyewe ya uendeshaji, si marekebisho ya maelekezo pekee: marudio yaliyoshinda yalijifunza kuchuja kelele za mitandao ya kijamii, yakaongeza hatua za kuhakiki ukweli na yakataka kila tokeo litegemee ushahidi ulio wazi. Mchoro ulio hapa chini unaonyesha mchakato wa marudio.

Chati ya mstari ya majaribio ya mafunzo ya Signal Engine inayoonyesha alama bora inayoendelea na alama zilizotengwa zikiboreka kutoka kiwango cha msingi cha seed kuelekea lengo kupitia majaribio ya mara kwa mara ya mgunduzi na mboreshaji.

Historia ya majaribio inaonyesha jinsi mafanikio hayo yalivyojengeka. Badiliko la mapema la muundo lilifikisha alama bora inayoendelea hadi 0.625; ushughulikiaji wa ushahidi wenye maelezo zaidi ukaifikisha 0.679; na mzunguko ulioboreshwa wa tafakari na rubriki ukaifikisha 0.819. Takriban nusu ya uendeshaji wote wa mapendekezo ulifanya vibaya au ukashindwa kabisa, lakini haukuchafua jedwali la viongozi: kila nakala iliendeshwa kwa kutengwa, tofauti zilizoshindwa zilitupiliwa mbali, na hitilafu ziliandikwa katika hifadhi ya tafakari ili mpendekezaji anayefuata asirudie njia ileile isiyofaa.

La muhimu zaidi, chati ya data iliyotengwa ilipanda pamoja na chati ya mafunzo wakati wote wa uendeshaji. Hilo linaonyesha kuwa mazingira ya uendeshaji yalikuwa yakiboresha mtiririko wa kazi badala ya kukariri mkusanyiko wa mafunzo. Alama zilizotengwa zilikuwa juu kidogo kuliko za mafunzo, jambo tunalotafsiri kuwa tofauti ya kawaida ya usampulishaji kati ya migawanyo miwili midogo isiyoingiliana.

Urejeshaji wa Midia Nyingi wa Kiwakala hupimwa kwa NDCG@10 kwenye mgawanyo wa umma wa ViDoRe V3 Computer Science, uliopangwa kuwa hoja 20 za mafunzo, 10 za ukuzaji na 20 za jaribio lililotengwa. Mazingira ya uendeshaji yaliongeza NDCG@10 iliyotengwa kutoka 0.705 hadi 0.744 huku yakipunguza jumla ya muda halisi wa tathmini kutoka sekunde 869 hadi sekunde 54.

Utafiti wa Kina hutathminiwa kwa kipimo mseto kinachohukumiwa na LLM kuhusu ubora wa maudhui na marejeleo, kwa kufuata DeepResearch-Eval, katika maswali 10 ya marejeleo. Msimbo ulioboreshwa uliongeza wastani kutoka 0.449 hadi 0.802. Mabadiliko yaliyoshinda yalionekana wazi kwenye tofauti: hatua ya awali ya kupanga inayolinganisha mbinu kabla ya mawakala wowote wa utafiti kutumwa, na hatua ya mwisho ya ukaguzi inayolenga vipengele ambavyo ripoti zilikuwa zikipata alama duni. Kwa kuwa seti hii ni ndogo na ghali kutathmini, hatukuigawanya na tunachukulia matokeo kuwa ya sampuli iliyotumika.

Ulinganisho na CORAL na karpathy/autoresearch

Chati za pau zinazolinganisha Meta-Harness, CORAL na karpathy/autoresearch kwa alama za Signal Engine, Urejeshaji wa Midia Nyingi wa Kiwakala na Utafiti wa Kina, pamoja na muda wa tathmini.

Tulilinganisha mbinu zote tatu kwa bajeti ileile: mikusanyiko ileile ya data, miundo ileile ya msingi, kikomo kilekile cha marudio na jumla ileile ya tathmini za mapendekezo. Kwenye Signal Engine, Meta-Harness hufikia 0.841 katika jaribio lililotengwa huku mbinu zote mbili za msingi zikibaki chini ya 0.50. Kwenye Urejeshaji wa Midia Nyingi wa Kiwakala, timu yetu ina NDCG@10 ya juu zaidi iliyotengwa (0.744 dhidi ya 0.700 kwa CORAL na 0.738 kwa karpathy) na huendesha tathmini rasmi kwa kasi ya mara 12 hadi 14: sekunde 54 dhidi ya sekunde 786 na 650. Kwenye Utafiti wa Kina, timu yetu hufikia 0.802 huku mbinu zote mbili za msingi zikibaki karibu na 0.52. Tahadhari moja inatumika kwa matokeo yote: tulitekeleza upya CORAL na karpathy/autoresearch kulingana na maelezo yao yaliyochapishwa, kwa hivyo sehemu ya tofauti inaweza kutokana na utekelezaji tofauti badala ya mbinu pekee.

Chaguo nne za usanifu zinaeleza tofauti hiyo. Kwanza, timu yetu huzalisha vipimo vilivyopangwa vya usanifu kabla ya msimbo wowote kuhaririwa, jambo linaloielekeza kwenye mabadiliko ya muundo kama hatua mpya za mfumo badala ya marekebisho ya maelekezo. Pili, huendesha nakala sambamba zinazotegemea pendekezo bora la pamoja la sasa, hivyo maboresho hujengeka haraka kuliko mawakala huru wa CORAL au mzunguko wa karpathy unaoendeshwa hatua moja baada ya nyingine. Tatu, kila jaribio huacha vielelezo vilivyopangwa (alama, kumbukumbu za matukio na uchanganuzi minne iliyoandikwa na LLM) ambavyo mpendekezaji anayefuata husoma, ilhali mbinu za msingi huhifadhi tu kumbukumbu tambarare za majaribio. Nne, kidhibiti kinachobadilika humwelekeza mpendekezaji kwenye ugunduzi baada ya kukwama na kwenye uboreshaji baada ya ushindi, huku Upangaji Upya Tabiri wa Nadharia Tete ukiondoa mawazo dhaifu kabla hayajatumia bajeti.

Mambo ambayo hatujaonyesha

Chati za data iliyotengwa zinaonyesha uwezo wa kufanya kazi katika kikoa kilekile, si kuhamishika kati ya vikoa: mtiririko ulioboreshwa kwa uchanganuzi wa ishara za soko la AI hautarajiwi kufanya vizuri kwenye maandishi ya kisheria au tiba bila kuendesha tena mazingira ya uendeshaji. Mazingira ya uendeshaji pia huboresha kile ambacho mtathmini amebainisha tu, kwa hivyo seti ya mafunzo yenye kelele au mwamuzi asiye na kalibati sahihi itafanyiwa ulinganishaji kupita kiasi; tunapendekeza angalau vipengee 20 vya mafunzo vilivyochaguliwa vizuri na mgawanyo tofauti wa ukuzaji kabla ya uendeshaji mkubwa. Gharama ndicho kikwazo kikubwa zaidi cha kiutendaji. Kila tathmini huendesha upya mfumo mzima kwenye migawanyo yote, pendekezo teule la urejeshaji pekee lilitumia takriban tokeni milioni 2.2 za ingizo, na uboreshaji mkubwa kwenye muundo wa kiwango cha gpt-5.5 hugharimu mamia hadi maelfu machache ya dola kwa kila kazi. Mwisho, nambari hizi zinatokana na uendeshaji mmoja badala ya majaribio yaliyorudiwa, ndiyo maana tunazishiriki kama chapisho la blogu ya uhandisi badala ya utafiti rasmi.

Hitimisho

Meta-Harness inaonyesha kuwa uboreshaji huru wa msimbo unaweza kudhibitiwa vya kutosha kwa matumizi ya biashara. Vipengele muhimu ni nadharia tete za kimuundo, uchujaji wa mapema wa kutabiri, tathmini iliyotengwa, majaribio yaliyotengwa pale data inaporuhusu na rekodi kamili ya ukaguzi kwa kila badiliko linalokubaliwa. Kwa pamoja, vinaipa timu ya uhandisi njia inayotabirika kutoka mfumo wa awali unaofanya kazi hadi ulioboreshwa kwa kiwango kinachopimika, na kumpa msimamizi wa shughuli muundo rahisi: manufaa ya ugunduzi huru yanayowekwa ndani ya mfumo mkali unaozingatia bajeti, huku mtu akihusika kabla ya chochote kusafirishwa.

Waandishi

David Huang, Bjorn Jee