ప్రధాన నావిగేషన్

మెటా-హార్నెస్: సురక్షిత స్వీయ-మెరుగుదల సంస్థాగత కృత్రిమ మేధ కార్యప్రవాహాలు

క్రమబద్ధమైన మెటా-హార్నెస్, దీర్ఘకాలిక కోడింగ్ పనుల్లో ఏజెంట్ కార్యప్రవాహాలను సంస్థాగత బృందాలు సురక్షితంగా మెరుగుపరచడంలో తోడ్పడుతుంది.

కార్యనిర్వాహక సారాంశం

  • ప్రస్తుత స్వయంప్రతిపత్త మెరుగుదల వ్యవస్థలు కోడింగ్ పనుల్లో బలమైన ఫలితాలు చూపాయి. అయితే వాస్తవ సంస్థాగత అమలులను పోలిన సంక్లిష్టమైన, దీర్ఘకాలిక కృత్రిమ మేధ కార్యప్రవాహాలను అవి మెరుగుపరచగలవా అనేది ఇంకా స్పష్టంగా లేదు.

  • మా మెటా-హార్నెస్ పరిశోధన, ఏజెంటిక్ పునరుద్ధరణ, డీప్ రీసెర్చ్, సంకేత నిఘా కార్యప్రవాహాలకు స్వయంప్రతిపత్త స్వీయ-మెరుగుదలను వర్తింపజేస్తుంది. దానితోపాటు విడిగా ఉంచిన మూల్యాంకనం, తనిఖీ చేయగల సామర్థ్యం, బడ్జెట్ నియంత్రణలు, మానవ ఆమోదం వంటి సంస్థాగత అవసరాలను జోడిస్తుంది.

  • మూడు ప్రాతినిధ్య పనిభారాల్లో మెటా-హార్నెస్ పనితీరును గణనీయంగా మెరుగుపరిచింది. సిగ్నల్ ఇంజిన్ విడిగా ఉంచిన పరీక్ష పనితీరులో 84% మెరుగుదల, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో 16× వేగవంతమైన అమలుతో అధిక ఖచ్చితత్వం సాధించింది.

  • మునుపటి విధానాల్లో చాలా వాటికి భిన్నంగా, ఆప్టిమైజేషన్‌లో ఉపయోగించిన డేటాను మించి మెరుగుదలలు సాధారణీకరిస్తాయో లేదో అంచనా వేయడానికి మెటా-హార్నెస్ వీలైన ప్రతిచోటా విడిగా ఉంచిన డేటాసెట్‌లపై విజయాన్ని కొలుస్తుంది.

  • స్వయంప్రతిపత్త కార్యప్రవాహ మెరుగుదల కోడింగ్ ప్రామాణిక పరీక్షలను దాటి వాస్తవ సంస్థాగత కృత్రిమ మేధ వ్యవస్థలకు విస్తరించగలదని ఈ ఫలితాలు సూచిస్తున్నాయి. నిరంతరం మెరుగయ్యే కృత్రిమ మేధ అనువర్తనాలకు ఇవి ఆచరణాత్మక మార్గాన్ని అందిస్తాయి.

మెటా-హార్నెస్ పరిశోధన పత్రం, CORAL ఫ్రేమ్‌వర్క్, karpathy/autoresearch సహా స్వయంప్రతిపత్త కృత్రిమ మేధ పరిశోధనపై ఇటీవలి కృషి, ఒక మూల్యాంకన ప్రమాణాన్ని ఇస్తే కోడింగ్ ఏజెంట్‌లు పరిష్కారాన్ని పునరావృతంగా మెరుగుపరచగలవని చూపింది. ఈ పద్ధతులు దీర్ఘకాలిక కృత్రిమ మేధ కార్యప్రవాహాలకు వర్తిస్తాయా అనేది ఇంకా తేలలేదు. ఉదాహరణకు, ప్రశ్నకు సమాధానం ఇవ్వడానికి ఏజెంట్ బహుమాధ్యమ రంగ పాఠ్య సముదాయాల్లో పునరావృతంగా వెతకాల్సిన ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ లేదా పరస్పరాధారిత దశలు, సాధనాల పిలుపులు, మినహాయింపు నిర్వహణ నిర్ణయాలు అనేకం అవసరమయ్యే సంక్లిష్ట డేటా ప్రాసెసింగ్ పైప్‌లైన్‌లు. ఆప్టిమైజర్ ఎప్పుడూ చూడని డేటాపై కూడా ఈ లాభాలు నిలుస్తాయా అనేదే మరింత లోతైన ప్రశ్న.

ఆ ప్రశ్నకు మా మెటా-హార్నెస్ పరిశోధన, అభివృద్ధే సమాధానం. ఇది ఇటీవలి పరిశోధనలోని ఆలోచనలను తీసుకుని సంస్థాగత అవసరాలకు అనుగుణంగా మలుస్తుంది: విడిగా ఉంచిన మూల్యాంకనం, తనిఖీ జాడలు, వ్యయ పరిమితులు, ఏదైనా విడుదలయ్యే ముందు మానవ సమీక్షకుడికి స్పష్టంగా అప్పగించే దశ.

వాస్తవ క్లయింట్ పనిని ఆధారంగా రూపొందించిన మూడు దీర్ఘకాలిక పనులపై మేము దీన్ని పరీక్షించాం. సిగ్నల్ ఇంజిన్ కృత్రిమ మేధ మార్కెట్ గురించి X పోస్ట్‌ల ప్రత్యక్ష ప్రవాహాన్ని పర్యవేక్షించి, పక్కా మూలాలతో నిర్మిత ధోరణి నివేదికలను రూపొందిస్తుంది. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ మిశ్రమ పాఠ్య-చిత్ర ప్రశ్నలపై తర్కించి, అత్యంత సంబంధిత పత్ర పేజీలను అందిస్తుంది. డీప్ రీసెర్చ్ వెబ్‌లో వెతకడం, మూలాలను పరస్పరం తనిఖీ చేయడం, సుదీర్ఘ పరిశోధన నివేదికలు రాయడం కోసం పలు ఏజెంట్‌లను సమన్వయపరుస్తుంది.

ఫలితాలు ఒక్క చూపులో

  • సిగ్నల్ ఇంజిన్: విడిగా ఉంచిన పరీక్ష మిశ్రమ స్కోరు 0.456 → 0.841, అంటే సాపేక్షంగా 84% వృద్ధి. అదే బడ్జెట్‌లో CORAL, karpathy/autoresearch రెండూ 0.50 కంటే తక్కువగానే నిలిచాయి.

  • ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ: విడిగా ఉంచిన NDCG@10 0.705 → 0.744కు పెరగగా, ప్రతి మూల్యాంకన వాస్తవ సమయం 869 సెకన్ల నుంచి 54 సెకన్లకు తగ్గింది. అంటే అధిక ఖచ్చితత్వంతో 16× వేగవృద్ధి.

  • డీప్ రీసెర్చ్: 10 సూచన ప్రశ్నల్లో నివేదిక నాణ్యత మిశ్రమ స్కోరు 0.449 → 0.802; ప్రాథమిక పద్ధతుల స్కోరు సుమారు 0.52. ఈ పనికి విడిగా ఉంచిన విభజన లేదు. అందువల్ల ఈ సంఖ్యను నమూనా అంతర్గత ఫలితంగానే పరిగణిస్తున్నాం.

  • అన్వేషణ సామర్థ్యం: ముందస్తు పరికల్పన పునఃర్యాంకింగ్‌తో, అదే మూల్యాంకన బడ్జెట్‌లో సిగ్నల్ ఇంజిన్ 20కు బదులు 3 పునరావృతాల్లోనే సూచన అమలు అత్యుత్తమ స్కోరులో 91% సాధించింది.

చాలా స్వయంప్రతిపత్త పరిశోధన వ్యవస్థలు ఒకే డేటాసెట్‌పై ఆప్టిమైజ్ చేసి మూల్యాంకనం చేస్తాయి. అందువల్ల ఫలితం సాధారణీకరిస్తుందో లేదో చెప్పడం అసాధ్యం. సిగ్నల్ ఇంజిన్, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో మేము కఠిన విభజనను అమలు చేస్తాం: అభ్యర్థులు స్కోరు చూడగల శిక్షణ సమితి, ప్రాథమిక తనిఖీలకు అభివృద్ధి సమితి, ఆప్టిమైజర్ ఎప్పుడూ చూడని విడిగా ఉంచిన పరీక్ష సమితి. నివేదించిన ప్రతి ఫలితం అన్ని విభజనలపై స్కోరు పొందిన ఒక నిర్దిష్ట కోడ్ సంస్కరణ నుంచే వస్తుంది. కాబట్టి ఒక అభ్యర్థి అత్యుత్తమ శిక్షణ స్కోరును మరొకరి అత్యుత్తమ పరీక్ష స్కోరుతో మేము ఎన్నడూ కలపం.

ఇది ఎలా పనిచేస్తుంది

ప్రతి దశలోనూ కోడ్‌ను మార్చేందుకు హార్నెస్ నిర్మిత పరికల్పనల సమూహాన్ని రూపొందిస్తుంది. ప్రతి పరికల్పన తాను మార్చాలనుకునే యంత్రాంగం, ఆధారంగా తీసుకునే మునుపటి సంస్కరణ, పరిష్కరించాలనుకునే వైఫల్య విధానాన్ని పేర్కొంటుంది. ఖరీదైన మూల్యాంకనాలకు వనరులు వెచ్చించే ముందే ర్యాంకింగ్ దశ ఈ సమూహాన్ని వడపోస్తుంది. మిగిలిన పరికల్పనలు ఉమ్మడి జ్ఞాన స్థావరాన్ని పంచుకునే సమాంతర కార్యకర్త ఏజెంట్‌లకు వెళ్తాయి. అయితే అవి పూర్తిగా వేరుచేసిన వర్క్‌స్పేస్‌లలో కోడ్‌ను సవరిస్తాయి కాబట్టి ప్రతి అభ్యర్థినీ న్యాయంగా, స్వతంత్రంగా అంచనా వేయవచ్చు. దశ ముగింపులో రన్నర్ ఒక విజేతను ఎంపిక చేస్తుంది: కనిపించే విభజనలపై ప్రతి తనిఖీనీ దాటి, అత్యధిక స్కోరు సాధించిన అభ్యర్థిని. తదుపరి దశకు ఆ విజేత అత్యాధునిక ఆధార సంస్కరణ అవుతుంది. ప్రతి ప్రయోగం తన కోడ్ ప్యాచ్, విభజనవారీ స్కోర్లు, ఈవెంట్ లాగ్‌తో పాటు దాని ట్రేస్, లోపాలు, వ్యయం, ఆత్మపరిశీలనపై LLM రాసిన నాలుగు సంక్షిప్త విశ్లేషణలను మార్పులు మాత్రమే జోడించగల ఆధారాల నిల్వలో స్థిర సముదాయంగా నమోదు చేస్తుంది. తదుపరి దశలోని ప్రతిపాదకుడు ఈ చరిత్రను తిరిగి చదువుతాడు. అందువల్ల హార్నెస్ అవే విఫల మార్గాలను మళ్లీ ప్రయత్నించకుండా నేర్చుకున్నదానిపై మరింతగా నిర్మించగలదు.

ఇన్‌పుట్‌లు, సీడ్ మూల్యాంకనం, పరికల్పన అన్వేషణ, సమాంతర ఏజెంట్ బృందాలు, మూల్యాంకన వర్క్‌స్పేస్, సమీక్ష ఫలితాలు, ఆధారాల నిల్వ, భద్రతా-వ్యయ నియంత్రణలను చూపే మెటా-హార్నెస్ కార్యప్రవాహ రేఖాచిత్రం.

మూడు రక్షణ నియమాలు ఈ చక్రాన్ని సురక్షితంగా నడిపిస్తాయి. అభ్యర్థి ఏ ఫైళ్లను మార్చవచ్చో పరిధి విధానం నియంత్రిస్తుంది; దాని వెలుపల చేసిన మార్పులను వెనక్కి తీసుకుంటుంది. వ్యయం గరిష్ఠ పరిమితిని దాటగానే టోకెన్, వాస్తవ సమయ బడ్జెట్‌లు అమలును ఆపుతాయి. సమకాలీనత పరిమితులు హార్నెస్‌ను మోడల్, GPU రేటు పరిమితుల్లో ఉంచుతాయి. అంతేకాక, హార్నెస్ స్వయంగా దేన్నీ విడుదల చేయదు. ఇది ర్యాంక్ చేసిన, పూర్తి పత్రాలతో కూడిన అభ్యర్థిని అందిస్తుంది. మానవ ఇంజనీర్ తేడాలను సమీక్షించి, దాన్ని ఉత్పత్తిలోకి పంపాలా వద్దా నిర్ణయిస్తారు.

అంతర్గతంగా

స్థానిక సాంకేతిక సముదాయంలో, పై చక్రంలోని ప్రతి దశకు ఐదు ప్రాథమిక ఇంజినీరింగ్ అంశాలు పునాదిగా ఉంటాయి.

  • వర్క్‌స్పేస్ వేర్పాటు. ప్రతి అభ్యర్థికి ఒక git వర్క్‌ట్రీ. ఫోర్క్‌లు ఒకే ఆబ్జెక్ట్ డేటాబేస్‌ను పంచుకుంటాయి కానీ పరస్పరం ఫైళ్లను పంచుకోవు. దీనివల్ల దాదాపు స్థిరమైన డిస్క్ వ్యయంతో అభ్యర్థులను సమాంతరంగా నడపవచ్చు; ప్రస్తుత అత్యాధునిక సంస్కరణతో తేడాలను సులభంగా చూడవచ్చు.

  • అమలు శాండ్‌బాక్స్. కాన్ఫిగరేషన్ ఆధారంగా రెండు విధానాలు: వేగంగా పునరావృతం చేయడానికి స్థానిక ఉపప్రక్రియ లేదా పూర్తిగా వేరుచేసిన రన్‌టైమ్. పాఠ్య సముదాయాలు చదవడానికి మాత్రమే అనుమతిస్తూ మౌంట్ అవుతాయి; ప్రతి ప్రయోగపు తాత్కాలిక డైరెక్టరీని గ్రేడింగ్ తర్వాత తొలగిస్తారు. ఫలితంగా, ఒక ప్రయోగం డేటాసెట్‌ను మార్చలేదు లేదా తన స్థితిని తదుపరి ప్రయోగానికి చేరవేయలేదు.

  • పరిధి విధానం. ప్రయోగ కాన్ఫిగరేషన్‌లో ప్రకటించిన అనుమతించిన పాత్‌ల జాబితా. దాని వెలుపల మారిన ప్రతిదాన్నీ ప్రయోగానికి గ్రేడ్ ఇచ్చే ముందు వెనక్కి తీసి, ఆ ప్రయోగాన్ని గుర్తిస్తారు. కాబట్టి సమీక్షకుడు చూసే తేడాలు ప్రకటించిన పరిధిలోనే ఉంటాయని హామీ ఉంటుంది.

  • బడ్జెట్ అమలు. మూడు పొరలు: ప్రతి ప్రయోగానికి టోకెన్, వాస్తవ సమయ పరిమితులు; ప్రతి అమలుకు మొత్తం గరిష్ఠ పరిమితి; సమకాలీనత పరిమితి. ఇవన్నీ కలిసి వ్యయాన్ని ముందే అంచనా వేయగలిగేలా చేసి, హార్నెస్‌ను మోడల్, మౌలిక సదుపాయాల రేటు పరిమితుల్లో ఉంచుతాయి.

  • ఆధారాల నిల్వ. కోడ్ ప్యాచ్, విభజనవారీ స్కోర్లు, ఈవెంట్ లాగ్, LLM రాసిన నాలుగు విశ్లేషణలతో మార్పులు మాత్రమే జోడించగల JSONL. ప్రతి ప్రయోగం తర్వాత సాకార వీక్షణలు (లీడర్‌బోర్డ్, అత్యాధునిక సంస్కరణ, వైఫల్య సూచిక) మళ్లీ రూపొందుతాయి. దీనివల్ల ప్రతి అమలును బైట్‌కు బైట్ పునరుత్పత్తి చేయగలిగేలా ఉంచుతూనే తదుపరి దశలు గత చరిత్రపై నిర్మించగలవు.

ఈ ప్రాథమిక అంశాల్లో ఏదీ ఐచ్ఛికం కాదు. అమలు ముగింపులో సమీక్షకుడు నిజంగా ఆమోదించగల ఫలితాన్ని అందించడమే హార్నెస్ ఉద్దేశం: విజేత అభ్యర్థి, పరిమిత తేడాలు, ప్రయత్నించిన ప్రతిదాని పూర్తి రికార్డు, తెలిసిన వ్యయం. ఈ ఐదింటిలో దేన్ని తొలగించినా, ఆ హామీల్లో ఒకటి పోతుంది.

ముందస్తు పరికల్పన పునఃర్యాంకింగ్

మూడు ప్రయోగాలూ ఒకే పరికల్పన వ్యూహాన్ని ఉపయోగిస్తాయి. ప్రతి పునరావృతంలో, బడ్జెట్‌తో అమలు చేయగలిగిన వాటికంటే ఎక్కువ పరికల్పనలను ప్రతిపాదకుడు రూపొందిస్తాడు: K = 4 పంపిణీ బడ్జెట్‌కు M = 8 అభ్యర్థులు. తర్వాత ప్రత్యేక LLM ర్యాంకర్ మొత్తం దృశ్యాన్ని ముందుంచుకుని, ముప్పై సెకన్ల ఒక్క పిలుపులో 8 ప్రతిపాదనలకూ క్రమం నిర్ణయిస్తుంది: ప్రస్తుత అత్యుత్తమ స్కోరు, దాని బలహీన కోణాలు, ఇటీవలి ప్రయోగాల వైఫల్య విశ్లేషణలు, పక్కపక్కనే మొత్తం 8 ప్రతిపాదనలు. అగ్ర 4 అభ్యర్థులు అమలుదారుకు వెళ్తాయి; ఒక్కోదానికి 15 నుంచి 30 నిమిషాల వ్యయం అవుతుంది. మిగతా 4 ఎలాంటి వ్యయం చేయకముందే తొలగిపోతాయి.

మూల్యాంకనాలు

అంతర్లీన మోడల్‌లను ప్రక్రియ అంతటా మార్చలేదు; హార్నెస్ వాటి చుట్టూ ఉన్న కోడ్‌ను మాత్రమే సవరించింది. సిగ్నల్ ఇంజిన్, డీప్ రీసెర్చ్ gpt-5.5పై నడిచాయి. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ, vLLM ద్వారా స్థానికంగా అందించిన ఓపెన్-వెయిట్ Qwen3.6-35B-A3Bపై, ColQwen3-4B చిత్ర పునరుద్ధరణ వ్యవస్థతో కలిసి నడిచింది. ప్రాంగణంలోనే ముందే అంచనా వేయగల వ్యయం కోసం ఈ కలయికను ఎంచుకున్నాం.

మా మూడు ప్రధాన పనుల స్కోర్లు ఎలా మారాయో కింది చార్ట్ చూపుతుంది. “సీడ్” అంటే మానవ ఇంజనీర్ రాసిన ప్రారంభ కోడ్. “మెటా-హార్నెస్” అంటే మెటా-హార్నెస్ కనుగొన్న అత్యుత్తమ సంస్కరణ. విడిగా ఉంచిన పరీక్ష సమితిలో మూడు పనుల పనితీరూ మెరుగుపడినట్లు చూశాం.

సిగ్నల్ ఇంజిన్, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ, డీప్ రీసెర్చ్‌లలో సీడ్, మెటా-హార్నెస్ పనితీరును పోల్చే బార్ చార్ట్. అన్ని విడిగా ఉంచిన పరీక్షల్లో మెటా-హార్నెస్ మెరుగ్గా ఉంది.

సిగ్నల్ ఇంజిన్ను తాజాదనం, వాస్తవికత, సూక్ష్మత, శైలి అంశాల్లో LLM న్యాయనిర్ణేతతో మూల్యాంకనం చేశాం. ఇందుకు 150 శిక్షణ ట్వీట్‌లు, విడిగా ఉంచిన 150 పరీక్ష ట్వీట్‌లను ఉపయోగించాం. అమలు వ్యవధిలో, అత్యుత్తమ సంస్కరణ శిక్షణ మిశ్రమ స్కోరును 0.431 నుంచి 0.756కు, విడిగా ఉంచిన స్కోరును 0.456 నుంచి 0.841కు మెరుగుపరిచింది. ఈ లాభాలు కేవలం ప్రాంప్ట్ సవరణల వల్ల కాకుండా హార్నెస్‌లోని మార్పుల వల్ల వచ్చాయి: విజేత పునరావృతాలు సామాజిక మాధ్యమాల అనవసర సమాచారాన్ని వడపోయడం నేర్చుకున్నాయి, వాస్తవాలను పరస్పరం తనిఖీ చేసే దశలను జోడించాయి, ప్రతి ఫలితానికి స్పష్టమైన ఆధారాన్ని తప్పనిసరి చేశాయి. పునరావృత ప్రక్రియను కింది రేఖాచిత్రం చూపుతుంది.

సిగ్నల్ ఇంజిన్ శిక్షణ ప్రయోగాల రేఖా చార్ట్. పునరావృత అన్వేషణ, మెరుగుదల ప్రయత్నాలతో అప్పటివరకు అత్యుత్తమ, విడిగా ఉంచిన స్కోర్లు సీడ్ ప్రాథమిక స్థాయి నుంచి లక్ష్యం వైపు మెరుగుపడటాన్ని చూపుతుంది.

ఆ లాభాలు ఎలా కూడబడ్డాయో ప్రయోగ చరిత్ర చూపుతుంది. ప్రారంభ నిర్మాణ మార్పు అప్పటివరకు అత్యుత్తమ స్కోరును 0.625కు పెంచింది; మరింత సూక్ష్మమైన ఆధారాల నిర్వహణ దాన్ని 0.679కు చేర్చింది; మెరుగుపరిచిన ఆత్మపరిశీలన-ప్రమాణాల చక్రం దాన్ని 0.819కు పెంచింది. అభ్యర్థి అమలుల్లో దాదాపు సగం తక్కువ పనితీరు చూపాయి లేదా పూర్తిగా విఫలమయ్యాయి. అయినా అవి లీడర్‌బోర్డ్‌ను కలుషితం చేయలేదు: ప్రతి ఫోర్క్ వేరుగా నడిచింది, ఓడిన మార్పులు తొలగించబడ్డాయి, తదుపరి ప్రతిపాదకుడు అదే విఫల మార్గాన్ని పునరావృతం చేయకుండా వైఫల్యాలను ఆత్మపరిశీలన నిల్వలో రాశారు.

ముఖ్యంగా, అమలు అంతటా శిక్షణ వక్రరేఖతోపాటు విడిగా ఉంచిన వక్రరేఖ కూడా పెరిగింది. శిక్షణ పాఠ్య సముదాయాన్ని కంఠస్థం చేయకుండా హార్నెస్ కార్యప్రవాహాన్ని మెరుగుపరిచిందని ఇది సూచిస్తుంది. విడిగా ఉంచిన స్కోర్లు శిక్షణ స్కోర్ల కంటే కాస్త ఎక్కువగా ఉన్నాయి. చిన్నవైన, పరస్పరం వేరైన రెండు విభజనల మధ్య సాధారణ నమూనా వ్యత్యాసంగానే దీన్ని భావిస్తున్నాం.

ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణను పబ్లిక్ ViDoRe V3 కంప్యూటర్ సైన్స్ విభజనపై NDCG@10తో కొలుస్తారు. దాన్ని 20 శిక్షణ, 10 అభివృద్ధి, విడిగా ఉంచిన 20 పరీక్ష ప్రశ్నలుగా రూపొందించారు. మొత్తం మూల్యాంకన వాస్తవ సమయాన్ని 869 సెకన్ల నుంచి 54 సెకన్లకు తగ్గిస్తూనే హార్నెస్ విడిగా ఉంచిన NDCG@10ను 0.705 నుంచి 0.744కు పెంచింది.

డీప్ రీసెర్చ్ను 10 సూచన ప్రశ్నల్లో, DeepResearch-Evalను అనుసరించి, విషయ నాణ్యత, సూచన నాణ్యతలపై LLM నిర్ణయించిన మిశ్రమ స్కోరుతో గ్రేడ్ చేస్తారు. మెరుగుపరిచిన కోడ్ సగటును 0.449 నుంచి 0.802కు పెంచింది. విజేత మార్పులు తేడాల్లో స్పష్టంగా కనిపించాయి: పరిశోధన ఏజెంట్‌లను పంపే ముందు విధానాలను పోల్చే ప్రారంభ ప్రణాళిక దశ, గతంలో నివేదికలు తక్కువ స్కోరు పొందిన కోణాలను లక్ష్యంగా చేసుకునే తుది సమీక్ష దశ. ఈ సమితి చిన్నది, మూల్యాంకనం ఖరీదైనది కాబట్టి దాన్ని విభజించలేదు. ఫలితాన్ని నమూనా అంతర్గతంగానే పరిగణిస్తున్నాం.

CORAL, karpathy/autoresearchతో పోలిక

సిగ్నల్ ఇంజిన్, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ, డీప్ రీసెర్చ్ స్కోర్లు, మూల్యాంకన జాప్యంలో మెటా-హార్నెస్, CORAL, karpathy/autoresearchలను పోల్చే బార్ చార్ట్‌లు.

మూడు పద్ధతులనూ ఒకే బడ్జెట్‌లో ప్రామాణికంగా పరీక్షించాం: అవే డేటాసెట్‌లు, అవే అంతర్లీన మోడల్‌లు, అదే పునరావృత పరిమితి, అదే మొత్తం అభ్యర్థి మూల్యాంకనాలు. సిగ్నల్ ఇంజిన్ విడిగా ఉంచిన పరీక్షలో మెటా-హార్నెస్ 0.841 సాధించగా, రెండు ప్రాథమిక పద్ధతులూ 0.50 కంటే తక్కువగానే నిలిచాయి. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో మా బృందం అత్యధిక విడిగా ఉంచిన NDCG@10ను సాధించింది (CORALకు 0.700, karpathyకి 0.738 కాగా మాకు 0.744). అధికారిక మూల్యాంకనాన్ని 12 నుంచి 14 రెట్లు వేగంగా నడిపింది: 786, 650 సెకన్లతో పోలిస్తే 54 సెకన్లు. డీప్ రీసెర్చ్‌లో మా బృందం 0.802 సాధించగా, రెండు ప్రాథమిక పద్ధతులూ సుమారు 0.52 వద్దే నిలిచాయి. అన్ని ఫలితాలకూ ఒక పరిమితి వర్తిస్తుంది: ప్రచురిత వివరణల ఆధారంగా CORAL, karpathy/autoresearchలను మేమే తిరిగి అమలు చేశాం. అందువల్ల కొంత వ్యత్యాసం పద్ధతుల్లోని తేడాలతోపాటు అమలు తేడాలను కూడా ప్రతిబింబించవచ్చు.

ఈ వ్యత్యాసానికి నాలుగు రూపకల్పన ఎంపికలు కారణం. మొదట, ఏ కోడ్‌నూ సవరించకముందే మా బృందం నిర్మిత రూపకల్పన నిర్దేశాన్ని రూపొందిస్తుంది. అందువల్ల ప్రాంప్ట్ సవరణలకు బదులు కొత్త పైప్‌లైన్ దశల వంటి నిర్మాణ మార్పులకు ప్రాధాన్యం లభిస్తుంది. రెండవది, ఉమ్మడి అత్యాధునిక అభ్యర్థిని ఆధారంగా చేసుకుని ఇది సమకాలీన ఫోర్క్‌లను నడుపుతుంది. అందువల్ల CORAL స్వతంత్ర ఏజెంట్‌లు లేదా karpathy పూర్తిగా వరుసగా నడిచే చక్రంతో పోలిస్తే మెరుగుదలలు వేగంగా కూడబడతాయి. మూడవది, ప్రతి ప్రయోగం తదుపరి ప్రతిపాదకుడు చదివే నిర్మిత అంశాలను వదిలివెళ్తుంది: స్కోర్లు, ఈవెంట్ లాగ్‌లు, LLM రాసిన నాలుగు విశ్లేషణలు. ప్రాథమిక పద్ధతులు మాత్రం సాధారణ ప్రయత్న లాగ్‌లను మాత్రమే ఉంచుతాయి. నాలుగవది, పురోగతి నిలిచిన తర్వాత అన్వేషణ వైపు, విజయం తర్వాత మెరుగుదల వైపు ప్రతిపాదకుడిని అనుకూల నియంత్రకం నడిపిస్తుంది. బడ్జెట్ ఖర్చయ్యే ముందే బలహీన ఆలోచనలను తొలగించడానికి దీనిపై ముందస్తు పరికల్పన పునఃర్యాంకింగ్ పనిచేస్తుంది.

మేము ఇంకా నిరూపించనివి

విడిగా ఉంచిన వక్రరేఖలు అదే రంగంలో సాధారణీకరణను చూపుతాయి, రంగాల మధ్య బదిలీని కాదు. కృత్రిమ మేధ మార్కెట్ సంకేతాల సేకరణ కోసం మెరుగుపరిచిన కార్యప్రవాహం, హార్నెస్‌ను మళ్లీ నడపకుండా న్యాయ లేదా జీవవైద్య పాఠ్యంపై కూడా నిలుస్తుందని ఆశించకూడదు. గ్రేడర్ నిర్వచించిన లక్ష్యాన్నే హార్నెస్ మెరుగుపరుస్తుంది. కాబట్టి శిక్షణ సమితిలో అనవసర సమాచారం ఉన్నా లేదా న్యాయనిర్ణేత సరిగా క్రమాంకనం కాకపోయినా, వాటికి కచ్చితంగా అతిగా సరిపోతుంది. గంభీరమైన అమలుకు ముందు కనీసం 20 జాగ్రత్తగా ఎంపిక చేసిన శిక్షణ అంశాలు, ప్రత్యేక అభివృద్ధి విభజన ఉండాలని సిఫారసు చేస్తున్నాం. వ్యయమే అతిపెద్ద ఆచరణాత్మక పరిమితి. ప్రతి మూల్యాంకనం అన్ని విభజనలపై పూర్తి పైప్‌లైన్‌ను మళ్లీ నడుపుతుంది. ఎంపికైన పునరుద్ధరణ అభ్యర్థి ఒక్కటే సుమారు 22 లక్షల ఇన్‌పుట్ టోకెన్‌లను వినియోగించింది. gpt-5.5 స్థాయి మోడల్‌పై గంభీరమైన ఆప్టిమైజేషన్‌కు ప్రతి పనికి కొన్ని వందల నుంచి వెయ్యికి పైగా డాలర్లు ఖర్చవుతాయి. చివరిగా, ఈ సంఖ్యలు పునరావృత ప్రయోగాల నుంచి కాకుండా ఒక్కో అమలు నుంచి వచ్చాయి. అందుకే వీటిని అధికారిక అధ్యయనంగా కాకుండా ఇంజినీరింగ్ బ్లాగ్ పోస్ట్‌గా పంచుకుంటున్నాం.

ముగింపు

స్వయంప్రతిపత్త కోడ్ మెరుగుదలను సంస్థాగత వినియోగానికి సరిపడా క్రమబద్ధం చేయవచ్చని మెటా-హార్నెస్ చూపిస్తుంది. నిర్మాణాత్మక పరికల్పనలు, ముందస్తు అంచనా వడపోత, వేరుచేసిన మూల్యాంకనం, డేటా అనుమతించిన ప్రతిచోటా విడిగా ఉంచిన పరీక్ష, ఎంపికైన ప్రతి మార్పు వెనుక పూర్తి తనిఖీ జాడ దీని కీలక అంశాలు. ఇవన్నీ కలిసి పనిచేసే సీడ్ పైప్‌లైన్ నుంచి కొలవగలిగేంత మెరుగైన పైప్‌లైన్‌కు చేరేందుకు ఇంజినీరింగ్ బృందానికి ముందే అంచనా వేయగల మార్గాన్ని ఇస్తాయి. కార్యకలాపాల యజమానికి సరళమైన నమూనాను అందిస్తాయి: స్వయంప్రతిపత్త అన్వేషణ ప్రయోజనాలను కఠినమైన, బడ్జెట్‌ను పరిగణించే ఫ్రేమ్‌వర్క్‌లో ఉంచి, ఏదైనా విడుదలయ్యే ముందు మానవుడిని నిర్ణయ ప్రక్రియలో భాగం చేయడం.

రచయితలు

David Huang, Bjorn Jee