ప్రస్తుత స్వయంప్రతిపత్త మెరుగుదల వ్యవస్థలు కోడింగ్ పనుల్లో బలమైన ఫలితాలు చూపాయి. అయితే వాస్తవ సంస్థాగత అమలులను పోలిన సంక్లిష్టమైన, దీర్ఘకాలిక కృత్రిమ మేధ కార్యప్రవాహాలను అవి మెరుగుపరచగలవా అనేది ఇంకా స్పష్టంగా లేదు.
మా మెటా-హార్నెస్ పరిశోధన, ఏజెంటిక్ పునరుద్ధరణ, డీప్ రీసెర్చ్, సంకేత నిఘా కార్యప్రవాహాలకు స్వయంప్రతిపత్త స్వీయ-మెరుగుదలను వర్తింపజేస్తుంది. దానితోపాటు విడిగా ఉంచిన మూల్యాంకనం, తనిఖీ చేయగల సామర్థ్యం, బడ్జెట్ నియంత్రణలు, మానవ ఆమోదం వంటి సంస్థాగత అవసరాలను జోడిస్తుంది.
మూడు ప్రాతినిధ్య పనిభారాల్లో మెటా-హార్నెస్ పనితీరును గణనీయంగా మెరుగుపరిచింది. సిగ్నల్ ఇంజిన్ విడిగా ఉంచిన పరీక్ష పనితీరులో 84% మెరుగుదల, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో 16× వేగవంతమైన అమలుతో అధిక ఖచ్చితత్వం సాధించింది.
మునుపటి విధానాల్లో చాలా వాటికి భిన్నంగా, ఆప్టిమైజేషన్లో ఉపయోగించిన డేటాను మించి మెరుగుదలలు సాధారణీకరిస్తాయో లేదో అంచనా వేయడానికి మెటా-హార్నెస్ వీలైన ప్రతిచోటా విడిగా ఉంచిన డేటాసెట్లపై విజయాన్ని కొలుస్తుంది.
స్వయంప్రతిపత్త కార్యప్రవాహ మెరుగుదల కోడింగ్ ప్రామాణిక పరీక్షలను దాటి వాస్తవ సంస్థాగత కృత్రిమ మేధ వ్యవస్థలకు విస్తరించగలదని ఈ ఫలితాలు సూచిస్తున్నాయి. నిరంతరం మెరుగయ్యే కృత్రిమ మేధ అనువర్తనాలకు ఇవి ఆచరణాత్మక మార్గాన్ని అందిస్తాయి.
మెటా-హార్నెస్ పరిశోధన పత్రం, CORAL ఫ్రేమ్వర్క్, karpathy/autoresearch సహా స్వయంప్రతిపత్త కృత్రిమ మేధ పరిశోధనపై ఇటీవలి కృషి, ఒక మూల్యాంకన ప్రమాణాన్ని ఇస్తే కోడింగ్ ఏజెంట్లు పరిష్కారాన్ని పునరావృతంగా మెరుగుపరచగలవని చూపింది. ఈ పద్ధతులు దీర్ఘకాలిక కృత్రిమ మేధ కార్యప్రవాహాలకు వర్తిస్తాయా అనేది ఇంకా తేలలేదు. ఉదాహరణకు, ప్రశ్నకు సమాధానం ఇవ్వడానికి ఏజెంట్ బహుమాధ్యమ రంగ పాఠ్య సముదాయాల్లో పునరావృతంగా వెతకాల్సిన ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ లేదా పరస్పరాధారిత దశలు, సాధనాల పిలుపులు, మినహాయింపు నిర్వహణ నిర్ణయాలు అనేకం అవసరమయ్యే సంక్లిష్ట డేటా ప్రాసెసింగ్ పైప్లైన్లు. ఆప్టిమైజర్ ఎప్పుడూ చూడని డేటాపై కూడా ఈ లాభాలు నిలుస్తాయా అనేదే మరింత లోతైన ప్రశ్న.
ఆ ప్రశ్నకు మా మెటా-హార్నెస్ పరిశోధన, అభివృద్ధే సమాధానం. ఇది ఇటీవలి పరిశోధనలోని ఆలోచనలను తీసుకుని సంస్థాగత అవసరాలకు అనుగుణంగా మలుస్తుంది: విడిగా ఉంచిన మూల్యాంకనం, తనిఖీ జాడలు, వ్యయ పరిమితులు, ఏదైనా విడుదలయ్యే ముందు మానవ సమీక్షకుడికి స్పష్టంగా అప్పగించే దశ.
వాస్తవ క్లయింట్ పనిని ఆధారంగా రూపొందించిన మూడు దీర్ఘకాలిక పనులపై మేము దీన్ని పరీక్షించాం. సిగ్నల్ ఇంజిన్ కృత్రిమ మేధ మార్కెట్ గురించి X పోస్ట్ల ప్రత్యక్ష ప్రవాహాన్ని పర్యవేక్షించి, పక్కా మూలాలతో నిర్మిత ధోరణి నివేదికలను రూపొందిస్తుంది. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ మిశ్రమ పాఠ్య-చిత్ర ప్రశ్నలపై తర్కించి, అత్యంత సంబంధిత పత్ర పేజీలను అందిస్తుంది. డీప్ రీసెర్చ్ వెబ్లో వెతకడం, మూలాలను పరస్పరం తనిఖీ చేయడం, సుదీర్ఘ పరిశోధన నివేదికలు రాయడం కోసం పలు ఏజెంట్లను సమన్వయపరుస్తుంది.
సిగ్నల్ ఇంజిన్: విడిగా ఉంచిన పరీక్ష మిశ్రమ స్కోరు 0.456 → 0.841, అంటే సాపేక్షంగా 84% వృద్ధి. అదే బడ్జెట్లో CORAL, karpathy/autoresearch రెండూ 0.50 కంటే తక్కువగానే నిలిచాయి.
ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ: విడిగా ఉంచిన NDCG@10 0.705 → 0.744కు పెరగగా, ప్రతి మూల్యాంకన వాస్తవ సమయం 869 సెకన్ల నుంచి 54 సెకన్లకు తగ్గింది. అంటే అధిక ఖచ్చితత్వంతో 16× వేగవృద్ధి.
డీప్ రీసెర్చ్: 10 సూచన ప్రశ్నల్లో నివేదిక నాణ్యత మిశ్రమ స్కోరు 0.449 → 0.802; ప్రాథమిక పద్ధతుల స్కోరు సుమారు 0.52. ఈ పనికి విడిగా ఉంచిన విభజన లేదు. అందువల్ల ఈ సంఖ్యను నమూనా అంతర్గత ఫలితంగానే పరిగణిస్తున్నాం.
అన్వేషణ సామర్థ్యం: ముందస్తు పరికల్పన పునఃర్యాంకింగ్తో, అదే మూల్యాంకన బడ్జెట్లో సిగ్నల్ ఇంజిన్ 20కు బదులు 3 పునరావృతాల్లోనే సూచన అమలు అత్యుత్తమ స్కోరులో 91% సాధించింది.
చాలా స్వయంప్రతిపత్త పరిశోధన వ్యవస్థలు ఒకే డేటాసెట్పై ఆప్టిమైజ్ చేసి మూల్యాంకనం చేస్తాయి. అందువల్ల ఫలితం సాధారణీకరిస్తుందో లేదో చెప్పడం అసాధ్యం. సిగ్నల్ ఇంజిన్, ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో మేము కఠిన విభజనను అమలు చేస్తాం: అభ్యర్థులు స్కోరు చూడగల శిక్షణ సమితి, ప్రాథమిక తనిఖీలకు అభివృద్ధి సమితి, ఆప్టిమైజర్ ఎప్పుడూ చూడని విడిగా ఉంచిన పరీక్ష సమితి. నివేదించిన ప్రతి ఫలితం అన్ని విభజనలపై స్కోరు పొందిన ఒక నిర్దిష్ట కోడ్ సంస్కరణ నుంచే వస్తుంది. కాబట్టి ఒక అభ్యర్థి అత్యుత్తమ శిక్షణ స్కోరును మరొకరి అత్యుత్తమ పరీక్ష స్కోరుతో మేము ఎన్నడూ కలపం.
ప్రతి దశలోనూ కోడ్ను మార్చేందుకు హార్నెస్ నిర్మిత పరికల్పనల సమూహాన్ని రూపొందిస్తుంది. ప్రతి పరికల్పన తాను మార్చాలనుకునే యంత్రాంగం, ఆధారంగా తీసుకునే మునుపటి సంస్కరణ, పరిష్కరించాలనుకునే వైఫల్య విధానాన్ని పేర్కొంటుంది. ఖరీదైన మూల్యాంకనాలకు వనరులు వెచ్చించే ముందే ర్యాంకింగ్ దశ ఈ సమూహాన్ని వడపోస్తుంది. మిగిలిన పరికల్పనలు ఉమ్మడి జ్ఞాన స్థావరాన్ని పంచుకునే సమాంతర కార్యకర్త ఏజెంట్లకు వెళ్తాయి. అయితే అవి పూర్తిగా వేరుచేసిన వర్క్స్పేస్లలో కోడ్ను సవరిస్తాయి కాబట్టి ప్రతి అభ్యర్థినీ న్యాయంగా, స్వతంత్రంగా అంచనా వేయవచ్చు. దశ ముగింపులో రన్నర్ ఒక విజేతను ఎంపిక చేస్తుంది: కనిపించే విభజనలపై ప్రతి తనిఖీనీ దాటి, అత్యధిక స్కోరు సాధించిన అభ్యర్థిని. తదుపరి దశకు ఆ విజేత అత్యాధునిక ఆధార సంస్కరణ అవుతుంది. ప్రతి ప్రయోగం తన కోడ్ ప్యాచ్, విభజనవారీ స్కోర్లు, ఈవెంట్ లాగ్తో పాటు దాని ట్రేస్, లోపాలు, వ్యయం, ఆత్మపరిశీలనపై LLM రాసిన నాలుగు సంక్షిప్త విశ్లేషణలను మార్పులు మాత్రమే జోడించగల ఆధారాల నిల్వలో స్థిర సముదాయంగా నమోదు చేస్తుంది. తదుపరి దశలోని ప్రతిపాదకుడు ఈ చరిత్రను తిరిగి చదువుతాడు. అందువల్ల హార్నెస్ అవే విఫల మార్గాలను మళ్లీ ప్రయత్నించకుండా నేర్చుకున్నదానిపై మరింతగా నిర్మించగలదు.


మూడు రక్షణ నియమాలు ఈ చక్రాన్ని సురక్షితంగా నడిపిస్తాయి. అభ్యర్థి ఏ ఫైళ్లను మార్చవచ్చో పరిధి విధానం నియంత్రిస్తుంది; దాని వెలుపల చేసిన మార్పులను వెనక్కి తీసుకుంటుంది. వ్యయం గరిష్ఠ పరిమితిని దాటగానే టోకెన్, వాస్తవ సమయ బడ్జెట్లు అమలును ఆపుతాయి. సమకాలీనత పరిమితులు హార్నెస్ను మోడల్, GPU రేటు పరిమితుల్లో ఉంచుతాయి. అంతేకాక, హార్నెస్ స్వయంగా దేన్నీ విడుదల చేయదు. ఇది ర్యాంక్ చేసిన, పూర్తి పత్రాలతో కూడిన అభ్యర్థిని అందిస్తుంది. మానవ ఇంజనీర్ తేడాలను సమీక్షించి, దాన్ని ఉత్పత్తిలోకి పంపాలా వద్దా నిర్ణయిస్తారు.
స్థానిక సాంకేతిక సముదాయంలో, పై చక్రంలోని ప్రతి దశకు ఐదు ప్రాథమిక ఇంజినీరింగ్ అంశాలు పునాదిగా ఉంటాయి.
వర్క్స్పేస్ వేర్పాటు. ప్రతి అభ్యర్థికి ఒక git వర్క్ట్రీ. ఫోర్క్లు ఒకే ఆబ్జెక్ట్ డేటాబేస్ను పంచుకుంటాయి కానీ పరస్పరం ఫైళ్లను పంచుకోవు. దీనివల్ల దాదాపు స్థిరమైన డిస్క్ వ్యయంతో అభ్యర్థులను సమాంతరంగా నడపవచ్చు; ప్రస్తుత అత్యాధునిక సంస్కరణతో తేడాలను సులభంగా చూడవచ్చు.
అమలు శాండ్బాక్స్. కాన్ఫిగరేషన్ ఆధారంగా రెండు విధానాలు: వేగంగా పునరావృతం చేయడానికి స్థానిక ఉపప్రక్రియ లేదా పూర్తిగా వేరుచేసిన రన్టైమ్. పాఠ్య సముదాయాలు చదవడానికి మాత్రమే అనుమతిస్తూ మౌంట్ అవుతాయి; ప్రతి ప్రయోగపు తాత్కాలిక డైరెక్టరీని గ్రేడింగ్ తర్వాత తొలగిస్తారు. ఫలితంగా, ఒక ప్రయోగం డేటాసెట్ను మార్చలేదు లేదా తన స్థితిని తదుపరి ప్రయోగానికి చేరవేయలేదు.
పరిధి విధానం. ప్రయోగ కాన్ఫిగరేషన్లో ప్రకటించిన అనుమతించిన పాత్ల జాబితా. దాని వెలుపల మారిన ప్రతిదాన్నీ ప్రయోగానికి గ్రేడ్ ఇచ్చే ముందు వెనక్కి తీసి, ఆ ప్రయోగాన్ని గుర్తిస్తారు. కాబట్టి సమీక్షకుడు చూసే తేడాలు ప్రకటించిన పరిధిలోనే ఉంటాయని హామీ ఉంటుంది.
బడ్జెట్ అమలు. మూడు పొరలు: ప్రతి ప్రయోగానికి టోకెన్, వాస్తవ సమయ పరిమితులు; ప్రతి అమలుకు మొత్తం గరిష్ఠ పరిమితి; సమకాలీనత పరిమితి. ఇవన్నీ కలిసి వ్యయాన్ని ముందే అంచనా వేయగలిగేలా చేసి, హార్నెస్ను మోడల్, మౌలిక సదుపాయాల రేటు పరిమితుల్లో ఉంచుతాయి.
ఆధారాల నిల్వ. కోడ్ ప్యాచ్, విభజనవారీ స్కోర్లు, ఈవెంట్ లాగ్, LLM రాసిన నాలుగు విశ్లేషణలతో మార్పులు మాత్రమే జోడించగల JSONL. ప్రతి ప్రయోగం తర్వాత సాకార వీక్షణలు (లీడర్బోర్డ్, అత్యాధునిక సంస్కరణ, వైఫల్య సూచిక) మళ్లీ రూపొందుతాయి. దీనివల్ల ప్రతి అమలును బైట్కు బైట్ పునరుత్పత్తి చేయగలిగేలా ఉంచుతూనే తదుపరి దశలు గత చరిత్రపై నిర్మించగలవు.
ఈ ప్రాథమిక అంశాల్లో ఏదీ ఐచ్ఛికం కాదు. అమలు ముగింపులో సమీక్షకుడు నిజంగా ఆమోదించగల ఫలితాన్ని అందించడమే హార్నెస్ ఉద్దేశం: విజేత అభ్యర్థి, పరిమిత తేడాలు, ప్రయత్నించిన ప్రతిదాని పూర్తి రికార్డు, తెలిసిన వ్యయం. ఈ ఐదింటిలో దేన్ని తొలగించినా, ఆ హామీల్లో ఒకటి పోతుంది.
మూడు ప్రయోగాలూ ఒకే పరికల్పన వ్యూహాన్ని ఉపయోగిస్తాయి. ప్రతి పునరావృతంలో, బడ్జెట్తో అమలు చేయగలిగిన వాటికంటే ఎక్కువ పరికల్పనలను ప్రతిపాదకుడు రూపొందిస్తాడు: K = 4 పంపిణీ బడ్జెట్కు M = 8 అభ్యర్థులు. తర్వాత ప్రత్యేక LLM ర్యాంకర్ మొత్తం దృశ్యాన్ని ముందుంచుకుని, ముప్పై సెకన్ల ఒక్క పిలుపులో 8 ప్రతిపాదనలకూ క్రమం నిర్ణయిస్తుంది: ప్రస్తుత అత్యుత్తమ స్కోరు, దాని బలహీన కోణాలు, ఇటీవలి ప్రయోగాల వైఫల్య విశ్లేషణలు, పక్కపక్కనే మొత్తం 8 ప్రతిపాదనలు. అగ్ర 4 అభ్యర్థులు అమలుదారుకు వెళ్తాయి; ఒక్కోదానికి 15 నుంచి 30 నిమిషాల వ్యయం అవుతుంది. మిగతా 4 ఎలాంటి వ్యయం చేయకముందే తొలగిపోతాయి.
అంతర్లీన మోడల్లను ప్రక్రియ అంతటా మార్చలేదు; హార్నెస్ వాటి చుట్టూ ఉన్న కోడ్ను మాత్రమే సవరించింది. సిగ్నల్ ఇంజిన్, డీప్ రీసెర్చ్ gpt-5.5పై నడిచాయి. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణ, vLLM ద్వారా స్థానికంగా అందించిన ఓపెన్-వెయిట్ Qwen3.6-35B-A3Bపై, ColQwen3-4B చిత్ర పునరుద్ధరణ వ్యవస్థతో కలిసి నడిచింది. ప్రాంగణంలోనే ముందే అంచనా వేయగల వ్యయం కోసం ఈ కలయికను ఎంచుకున్నాం.
మా మూడు ప్రధాన పనుల స్కోర్లు ఎలా మారాయో కింది చార్ట్ చూపుతుంది. “సీడ్” అంటే మానవ ఇంజనీర్ రాసిన ప్రారంభ కోడ్. “మెటా-హార్నెస్” అంటే మెటా-హార్నెస్ కనుగొన్న అత్యుత్తమ సంస్కరణ. విడిగా ఉంచిన పరీక్ష సమితిలో మూడు పనుల పనితీరూ మెరుగుపడినట్లు చూశాం.


సిగ్నల్ ఇంజిన్ను తాజాదనం, వాస్తవికత, సూక్ష్మత, శైలి అంశాల్లో LLM న్యాయనిర్ణేతతో మూల్యాంకనం చేశాం. ఇందుకు 150 శిక్షణ ట్వీట్లు, విడిగా ఉంచిన 150 పరీక్ష ట్వీట్లను ఉపయోగించాం. అమలు వ్యవధిలో, అత్యుత్తమ సంస్కరణ శిక్షణ మిశ్రమ స్కోరును 0.431 నుంచి 0.756కు, విడిగా ఉంచిన స్కోరును 0.456 నుంచి 0.841కు మెరుగుపరిచింది. ఈ లాభాలు కేవలం ప్రాంప్ట్ సవరణల వల్ల కాకుండా హార్నెస్లోని మార్పుల వల్ల వచ్చాయి: విజేత పునరావృతాలు సామాజిక మాధ్యమాల అనవసర సమాచారాన్ని వడపోయడం నేర్చుకున్నాయి, వాస్తవాలను పరస్పరం తనిఖీ చేసే దశలను జోడించాయి, ప్రతి ఫలితానికి స్పష్టమైన ఆధారాన్ని తప్పనిసరి చేశాయి. పునరావృత ప్రక్రియను కింది రేఖాచిత్రం చూపుతుంది.


ఆ లాభాలు ఎలా కూడబడ్డాయో ప్రయోగ చరిత్ర చూపుతుంది. ప్రారంభ నిర్మాణ మార్పు అప్పటివరకు అత్యుత్తమ స్కోరును 0.625కు పెంచింది; మరింత సూక్ష్మమైన ఆధారాల నిర్వహణ దాన్ని 0.679కు చేర్చింది; మెరుగుపరిచిన ఆత్మపరిశీలన-ప్రమాణాల చక్రం దాన్ని 0.819కు పెంచింది. అభ్యర్థి అమలుల్లో దాదాపు సగం తక్కువ పనితీరు చూపాయి లేదా పూర్తిగా విఫలమయ్యాయి. అయినా అవి లీడర్బోర్డ్ను కలుషితం చేయలేదు: ప్రతి ఫోర్క్ వేరుగా నడిచింది, ఓడిన మార్పులు తొలగించబడ్డాయి, తదుపరి ప్రతిపాదకుడు అదే విఫల మార్గాన్ని పునరావృతం చేయకుండా వైఫల్యాలను ఆత్మపరిశీలన నిల్వలో రాశారు.
ముఖ్యంగా, అమలు అంతటా శిక్షణ వక్రరేఖతోపాటు విడిగా ఉంచిన వక్రరేఖ కూడా పెరిగింది. శిక్షణ పాఠ్య సముదాయాన్ని కంఠస్థం చేయకుండా హార్నెస్ కార్యప్రవాహాన్ని మెరుగుపరిచిందని ఇది సూచిస్తుంది. విడిగా ఉంచిన స్కోర్లు శిక్షణ స్కోర్ల కంటే కాస్త ఎక్కువగా ఉన్నాయి. చిన్నవైన, పరస్పరం వేరైన రెండు విభజనల మధ్య సాధారణ నమూనా వ్యత్యాసంగానే దీన్ని భావిస్తున్నాం.
ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణను పబ్లిక్ ViDoRe V3 కంప్యూటర్ సైన్స్ విభజనపై NDCG@10తో కొలుస్తారు. దాన్ని 20 శిక్షణ, 10 అభివృద్ధి, విడిగా ఉంచిన 20 పరీక్ష ప్రశ్నలుగా రూపొందించారు. మొత్తం మూల్యాంకన వాస్తవ సమయాన్ని 869 సెకన్ల నుంచి 54 సెకన్లకు తగ్గిస్తూనే హార్నెస్ విడిగా ఉంచిన NDCG@10ను 0.705 నుంచి 0.744కు పెంచింది.
డీప్ రీసెర్చ్ను 10 సూచన ప్రశ్నల్లో, DeepResearch-Evalను అనుసరించి, విషయ నాణ్యత, సూచన నాణ్యతలపై LLM నిర్ణయించిన మిశ్రమ స్కోరుతో గ్రేడ్ చేస్తారు. మెరుగుపరిచిన కోడ్ సగటును 0.449 నుంచి 0.802కు పెంచింది. విజేత మార్పులు తేడాల్లో స్పష్టంగా కనిపించాయి: పరిశోధన ఏజెంట్లను పంపే ముందు విధానాలను పోల్చే ప్రారంభ ప్రణాళిక దశ, గతంలో నివేదికలు తక్కువ స్కోరు పొందిన కోణాలను లక్ష్యంగా చేసుకునే తుది సమీక్ష దశ. ఈ సమితి చిన్నది, మూల్యాంకనం ఖరీదైనది కాబట్టి దాన్ని విభజించలేదు. ఫలితాన్ని నమూనా అంతర్గతంగానే పరిగణిస్తున్నాం.


మూడు పద్ధతులనూ ఒకే బడ్జెట్లో ప్రామాణికంగా పరీక్షించాం: అవే డేటాసెట్లు, అవే అంతర్లీన మోడల్లు, అదే పునరావృత పరిమితి, అదే మొత్తం అభ్యర్థి మూల్యాంకనాలు. సిగ్నల్ ఇంజిన్ విడిగా ఉంచిన పరీక్షలో మెటా-హార్నెస్ 0.841 సాధించగా, రెండు ప్రాథమిక పద్ధతులూ 0.50 కంటే తక్కువగానే నిలిచాయి. ఏజెంటిక్ బహుమాధ్యమ పునరుద్ధరణలో మా బృందం అత్యధిక విడిగా ఉంచిన NDCG@10ను సాధించింది (CORALకు 0.700, karpathyకి 0.738 కాగా మాకు 0.744). అధికారిక మూల్యాంకనాన్ని 12 నుంచి 14 రెట్లు వేగంగా నడిపింది: 786, 650 సెకన్లతో పోలిస్తే 54 సెకన్లు. డీప్ రీసెర్చ్లో మా బృందం 0.802 సాధించగా, రెండు ప్రాథమిక పద్ధతులూ సుమారు 0.52 వద్దే నిలిచాయి. అన్ని ఫలితాలకూ ఒక పరిమితి వర్తిస్తుంది: ప్రచురిత వివరణల ఆధారంగా CORAL, karpathy/autoresearchలను మేమే తిరిగి అమలు చేశాం. అందువల్ల కొంత వ్యత్యాసం పద్ధతుల్లోని తేడాలతోపాటు అమలు తేడాలను కూడా ప్రతిబింబించవచ్చు.
ఈ వ్యత్యాసానికి నాలుగు రూపకల్పన ఎంపికలు కారణం. మొదట, ఏ కోడ్నూ సవరించకముందే మా బృందం నిర్మిత రూపకల్పన నిర్దేశాన్ని రూపొందిస్తుంది. అందువల్ల ప్రాంప్ట్ సవరణలకు బదులు కొత్త పైప్లైన్ దశల వంటి నిర్మాణ మార్పులకు ప్రాధాన్యం లభిస్తుంది. రెండవది, ఉమ్మడి అత్యాధునిక అభ్యర్థిని ఆధారంగా చేసుకుని ఇది సమకాలీన ఫోర్క్లను నడుపుతుంది. అందువల్ల CORAL స్వతంత్ర ఏజెంట్లు లేదా karpathy పూర్తిగా వరుసగా నడిచే చక్రంతో పోలిస్తే మెరుగుదలలు వేగంగా కూడబడతాయి. మూడవది, ప్రతి ప్రయోగం తదుపరి ప్రతిపాదకుడు చదివే నిర్మిత అంశాలను వదిలివెళ్తుంది: స్కోర్లు, ఈవెంట్ లాగ్లు, LLM రాసిన నాలుగు విశ్లేషణలు. ప్రాథమిక పద్ధతులు మాత్రం సాధారణ ప్రయత్న లాగ్లను మాత్రమే ఉంచుతాయి. నాలుగవది, పురోగతి నిలిచిన తర్వాత అన్వేషణ వైపు, విజయం తర్వాత మెరుగుదల వైపు ప్రతిపాదకుడిని అనుకూల నియంత్రకం నడిపిస్తుంది. బడ్జెట్ ఖర్చయ్యే ముందే బలహీన ఆలోచనలను తొలగించడానికి దీనిపై ముందస్తు పరికల్పన పునఃర్యాంకింగ్ పనిచేస్తుంది.
విడిగా ఉంచిన వక్రరేఖలు అదే రంగంలో సాధారణీకరణను చూపుతాయి, రంగాల మధ్య బదిలీని కాదు. కృత్రిమ మేధ మార్కెట్ సంకేతాల సేకరణ కోసం మెరుగుపరిచిన కార్యప్రవాహం, హార్నెస్ను మళ్లీ నడపకుండా న్యాయ లేదా జీవవైద్య పాఠ్యంపై కూడా నిలుస్తుందని ఆశించకూడదు. గ్రేడర్ నిర్వచించిన లక్ష్యాన్నే హార్నెస్ మెరుగుపరుస్తుంది. కాబట్టి శిక్షణ సమితిలో అనవసర సమాచారం ఉన్నా లేదా న్యాయనిర్ణేత సరిగా క్రమాంకనం కాకపోయినా, వాటికి కచ్చితంగా అతిగా సరిపోతుంది. గంభీరమైన అమలుకు ముందు కనీసం 20 జాగ్రత్తగా ఎంపిక చేసిన శిక్షణ అంశాలు, ప్రత్యేక అభివృద్ధి విభజన ఉండాలని సిఫారసు చేస్తున్నాం. వ్యయమే అతిపెద్ద ఆచరణాత్మక పరిమితి. ప్రతి మూల్యాంకనం అన్ని విభజనలపై పూర్తి పైప్లైన్ను మళ్లీ నడుపుతుంది. ఎంపికైన పునరుద్ధరణ అభ్యర్థి ఒక్కటే సుమారు 22 లక్షల ఇన్పుట్ టోకెన్లను వినియోగించింది. gpt-5.5 స్థాయి మోడల్పై గంభీరమైన ఆప్టిమైజేషన్కు ప్రతి పనికి కొన్ని వందల నుంచి వెయ్యికి పైగా డాలర్లు ఖర్చవుతాయి. చివరిగా, ఈ సంఖ్యలు పునరావృత ప్రయోగాల నుంచి కాకుండా ఒక్కో అమలు నుంచి వచ్చాయి. అందుకే వీటిని అధికారిక అధ్యయనంగా కాకుండా ఇంజినీరింగ్ బ్లాగ్ పోస్ట్గా పంచుకుంటున్నాం.
స్వయంప్రతిపత్త కోడ్ మెరుగుదలను సంస్థాగత వినియోగానికి సరిపడా క్రమబద్ధం చేయవచ్చని మెటా-హార్నెస్ చూపిస్తుంది. నిర్మాణాత్మక పరికల్పనలు, ముందస్తు అంచనా వడపోత, వేరుచేసిన మూల్యాంకనం, డేటా అనుమతించిన ప్రతిచోటా విడిగా ఉంచిన పరీక్ష, ఎంపికైన ప్రతి మార్పు వెనుక పూర్తి తనిఖీ జాడ దీని కీలక అంశాలు. ఇవన్నీ కలిసి పనిచేసే సీడ్ పైప్లైన్ నుంచి కొలవగలిగేంత మెరుగైన పైప్లైన్కు చేరేందుకు ఇంజినీరింగ్ బృందానికి ముందే అంచనా వేయగల మార్గాన్ని ఇస్తాయి. కార్యకలాపాల యజమానికి సరళమైన నమూనాను అందిస్తాయి: స్వయంప్రతిపత్త అన్వేషణ ప్రయోజనాలను కఠినమైన, బడ్జెట్ను పరిగణించే ఫ్రేమ్వర్క్లో ఉంచి, ఏదైనా విడుదలయ్యే ముందు మానవుడిని నిర్ణయ ప్రక్రియలో భాగం చేయడం.