বিদ্যমান স্বয়ংক্রিয়-উন্নয়ন ব্যবস্থা coding task-এ শক্তিশালী ফল দেখিয়েছে, কিন্তু বাস্তব enterprise deployment-এর মতো জটিল, দীর্ঘ-পরিসরের কৃত্রিম বুদ্ধিমত্তা কর্মপ্রবাহ উন্নত করতে পারে কি না তা এখনো স্পষ্ট নয়.
আমাদের Meta-Harness Research স্বায়ত্তশাসিত স্ব-উন্নয়নকে (self-improvement) এজেন্টিক রিট্রিভাল, ডিপ রিসার্চ এবং সিগন্যাল ইন্টেলিজেন্স ওয়ার্কফ্লোতে প্রয়োগ করে, এবং পাশাপাশি হেল্ড-আউট মূল্যায়ন, অডিটযোগ্যতা, বাজেট নিয়ন্ত্রণ ও মানব অনুমোদনের মতো এন্টারপ্রাইজ প্রয়োজনীয়তা যুক্ত করে.
তিনটি প্রতিনিধিত্বমূলক workload-এ Meta-Harness কর্মক্ষমতা উল্লেখযোগ্যভাবে বাড়িয়েছে; এর মধ্যে Signal Engine-এর held-out test performance-এ 84% উন্নতি এবং Agentic Multimodal Retrieval-এ বেশি accuracy সহ 16× দ্রুত execution রয়েছে.
আগের অধিকাংশ পদ্ধতির বিপরীতে, Meta-Harness যেখানে সম্ভব held-out dataset-এ সফলতা মাপে, যাতে optimization-এ ব্যবহৃত data-এর বাইরে উন্নতি generalise করে কি না তা মূল্যায়ন করা যায়.
এই ফলাফলগুলো দেখায় যে স্বয়ংক্রিয় workflow improvement coding benchmark ছাড়িয়ে বাস্তব enterprise কৃত্রিম বুদ্ধিমত্তা system-এ প্রসারিত হতে পারে এবং ধারাবাহিকভাবে উন্নত হতে থাকা কৃত্রিম বুদ্ধিমত্তা application-এর দিকে একটি বাস্তব পথ দিতে পারে.
স্বয়ংক্রিয় কৃত্রিম বুদ্ধিমত্তা research নিয়ে সাম্প্রতিক কাজ, যেমন Meta-Harness paper, CORAL framework এবং karpathy/autoresearch, দেখিয়েছে যে coding এজেন্ট একটি evaluation metric পেলে iteratively কোনো solution উন্নত করতে পারে. যা এখনো খোলা প্রশ্ন, তা হলো এসব পদ্ধতি দীর্ঘ-পরিসরের কৃত্রিম বুদ্ধিমত্তা কর্মপ্রবাহে কাজ করে কি না; যেমন এজেন্টভিত্তিক multimodal retrieval, যেখানে একটি এজেন্টকে প্রশ্নের উত্তর দিতে multimodal domain corpus জুড়ে বারবার search করতে হয়, অথবা জটিল data-processing pipeline যেখানে বহু dependent step, tool call ও exception-handling decision লাগে. আরও গভীর প্রশ্ন হলো optimizer যে data কখনো দেখে না, সেখানে অর্জনগুলো টিকে থাকে কি না.
আমাদের Meta-Harness R&D সেই প্রশ্নের উত্তর. এটি সাম্প্রতিক research থেকে ধারণা নিয়ে enterprise প্রয়োজনকে কেন্দ্র করে সেগুলো নতুনভাবে সাজায়: held-out evaluation, audit trail, cost ceiling এবং কিছু ship হওয়ার আগে human reviewer-এর কাছে স্পষ্ট hand-off point.
আমরা বাস্তব ক্লায়েন্টের কাজের মডেলে তৈরি তিনটি দীর্ঘমেয়াদি কাজের ওপর এটি পরীক্ষা করেছি. Signal Engine এআই মার্কেট সম্পর্কিত এক্স-এর (X) লাইভ পোস্টের ওপর নজর রাখে এবং সুনির্দিষ্ট উৎসসহ সুবিন্যস্ত ট্রেন্ড রিপোর্ট তৈরি করে. Agentic Multimodal Retrieval সবচেয়ে প্রাসঙ্গিক ডকুমেন্টের পৃষ্ঠাগুলো এনে দেওয়ার জন্য টেক্সট ও ছবির মিশ্রিত কুয়েরিগুলো নিয়ে যুক্তিভিত্তিক বিশ্লেষণ করে. ডীপ রিসার্চ ওয়েবে অনুসন্ধান করা, উৎসগুলো একাধিক উপায়ে যাচাই করা এবং বিস্তারিত গবেষণা প্রতিবেদন লেখার জন্য একাধিক এজেন্টকে পরিচালিত করে.
Signal Engine: held-out test composite 0.456 → 0.841, আপেক্ষিকভাবে 84% lift. একই budget-এ CORAL ও karpathy/autoresearch 0.50-এর নিচেই ছিল.
Agentic Multimodal Retrieval: held-out NDCG@10 0.705 → 0.744, আর প্রতি-evaluation বাস্তব-সময় 869s থেকে 54s-এ নেমেছে. অর্থাৎ বেশি accuracy-সহ 16× speed-up.
ডীপ রিসার্চ: দশটি reference question জুড়ে report-quality composite 0.449 → 0.802, যেখানে baseline প্রায় 0.52. এই task-এ কোনো held-out split ছিল না, তাই সংখ্যাটিকে আমরা শুধু in-sample হিসেবে ধরি.
Search efficiency: Predictive Hypothesis Reranking দিয়ে Signal Engine একই evaluation budget-এ 20 iteration-এর বদলে 3 iteration-এ reference run-এর সেরা score-এর 91%-এ পৌঁছেছে.
বেশিরভাগ স্বায়ত্তশাসিত-গবেষণা সিস্টেম একই ডেটাসেটের ওপর অপটিমাইজ ও মূল্যায়ন করে, যার ফলে ফলাফলের সার্বজনীনতা বা কার্যকারিতা (generalisation) যাচাই করা অসম্ভব হয়ে পড়ে. Signal Engine এবং Agentic Multimodal Retrieval-এর ক্ষেত্রে আমরা একটি কঠোর বিভাজন বজায় রাখি: একটি ট্রেইনিং সেট যার বিপরীতে ক্যান্ডিডেটগুলো স্কোর করতে পারে, একটি ডেভলপমেন্ট সেট অনাকাঙ্ক্ষিত ভুল বা ডেটার সামঞ্জস্য যাচাইয়ের (sanity checks) জন্য এবং একটি পৃথক বা অলক্ষিত টেস্ট সেট (held-out test set) যা অপটিমাইজার কখনো দেখতে পায় না. প্রতিটি প্রকাশিত ফলাফল প্রতিটি বিভাজনে স্কোর করা একটি নির্দিষ্ট কোড ভার্সন থেকে আসে, তাই আমরা কখনো এক ক্যান্ডিডেটের সেরা ট্রেইনিং স্কোরের সাথে অন্য ক্যান্ডিডেটের সেরা টেস্ট স্কোরের মিশ্রণ ঘটাই না.
প্রতিটি রাউন্ডে, কোডে পরিবর্তনের জন্য হারনেস কতগুলো স্ট্রাকচার্ড হাইপোথিসিসের একটি ব্যাচ তৈরি করে. প্রতিটি হাইপোথিসিস যে প্রক্রিয়াটি পরিবর্তন করতে চায়, এটি যে পূর্ববর্তী ভার্সনের ওপর ভিত্তি করে তৈরি এবং যে ফেইলিওর মোডকে টার্গেট করে তার নাম উল্লেখ করে. যেকোনো ব্যয়বহুল মূল্যায়ন করার আগেই একটি র্যাঙ্কিং ধাপের মাধ্যমে ব্যাচটি ফিল্টার বা বাছাই করা হয়. টিকে থাকা হাইপোথিসিসগুলো সমান্তরাল ওয়ার্কার এজেন্টগুলোর কাছে যায় যারা একটি সাধারণ নলেজ বেস শেয়ার করে ঠিকই, কিন্তু সম্পূর্ণ বিচ্ছিন্ন ওয়ার্কস্পেসের মধ্যে কোড এডিট করে; ফলে প্রতিটি ক্যান্ডিডেটকে নিরপেক্ষ ও স্বাধীনভাবে গ্রেড করা সম্ভব হয়. রাউন্ডের শেষে, রানার একজন বিজয়ীকে উন্নীত (promote) করে: সর্বোচ্চ স্কোরকারী ক্যান্ডিডেট যে দৃশ্যমান বিভাজনগুলোর (visible splits) প্রতিটি চেকে উত্তীর্ণ হয়েছে. সেই বিজয়ীই পরবর্তী রাউন্ড নির্মাণের ভিত্তি বা ফ্রন্টিয়ার হয়ে ওঠে. প্রতিটি ট্রায়াল একটি অ্যাপেন্ড-অনলি এভিডেন্স স্টোরে একটি নির্দিষ্ট বান্ডেল লেখে: এর কোড প্যাচ, প্রতি স্প্লিটের স্কোর, একটি ইভেন্ট লগ এবং এর ট্রেস, ত্রুটি, খরচ ও রিফ্লেকশন কভার করে LLM-এর লেখা চারটি সংক্ষিপ্ত বিশ্লেষণ. পরবর্তী রাউন্ডের প্রপোজার এই ইতিহাসটি পড়ে পর্যবেক্ষণ করে, আর এভাবেই হারনেস একই অকার্যকর পথের পুনরাবৃত্তি না করে তার শেখা বিষয়গুলোকে আরও সমৃদ্ধ ও জোরদার করে তোলে.


তিনটি guardrail লুপটি নিরাপদে চালু রাখে. একটি scope policy কোন ফাইল প্রার্থী ছুঁতে পারবে তা সীমিত করে এবং তার বাইরে কিছু হলে ফিরিয়ে দেয়. টোকেন ও বাস্তব-সময়ের বাজেট খরচ নির্ধারিত সীমা পেরোলেই run থামায়; concurrency সীমা কার্যপরিধিকে মডেল ও GPU rate limit-এর ভেতরে রাখে. আর কার্যপরিধি নিজে কখনো কিছু ship করে না. এটি র্যাঙ্ক করা, সম্পূর্ণ নথিবদ্ধ একটি প্রার্থী তৈরি করে, আর একজন মানব প্রকৌশলী diff পর্যালোচনা করে সিদ্ধান্ত নেন সেটি production-এ যাবে কি না.
স্থানীয় stack-এ ওপরের লুপের প্রতিটি রাউন্ডের নিচে পাঁচটি প্রকৌশলগত মৌলিক উপাদান থাকে.
ওয়ার্কস্পেস বিচ্ছিন্নতা. প্রতি ক্যান্ডিডেটের জন্য একটি করে গিট ওয়ার্কট্রি (git worktree). ফোর্কগুলো একটি অবজেক্ট ডাটাবেস শেয়ার করে কিন্তু কখনোই একে অপরের ফাইল শেয়ার করে না, যা প্রায় ধ্রুবক ডিস্ক খরচে (near-constant disk cost) ক্যান্ডিডেটগুলোকে সমান্তরালভাবে রান করতে দেয় এবং বর্তমান ফ্রন্টিয়ারের সাথে ডিফ (diff) করা সহজ করে তোলে.
নির্বাহ sandbox. Config অনুযায়ী dual-mode: দ্রুত iteration-এর জন্য native subprocess অথবা সম্পূর্ণ বিচ্ছিন্ন runtime. Corpora read-only হিসেবে mount হয়, আর প্রতি-trial scratch directory grading-এর পর ফেলে দেওয়া হয়. ফলে কোনো trial dataset বদলাতে পারে না বা পরের trial-এ state ফাঁস করতে পারে না.
Scope policy. Experiment config-এ ঘোষিত একটি path allow-list. এর বাইরে কিছু স্পর্শ করা হলে trial grade করার আগে তা ফিরিয়ে দেওয়া হয় এবং trial-টি flag করা হয়. ফলে reviewer যে diff দেখেন, তা ঘোষিত scope-এর মধ্যেই থাকবে বলে নিশ্চিত.
Budget enforcement. তিনটি স্তর: প্রতি-trial টোকেন ও বাস্তব-সময় cap, প্রতি-run মোট ceiling এবং concurrency limit. একসঙ্গে এগুলো খরচকে পূর্বানুমেয় রাখে এবং কার্যপরিধি মডেল ও অবকাঠামোর সীমার ভেতরে থাকে তা নিশ্চিত করে.
প্রমাণভান্ডার. Code patch, split-ভিত্তিক score, event log এবং চারটি LLM-লিখিত analysis-এর append-only JSONL. Materialised view (leaderboard, frontier, failure index) প্রতিটি trial-এর পর পুনরায় তৈরি হয়, ফলে পরের রাউন্ডগুলো আগের ইতিহাসের ওপর দাঁড়াতে পারে এবং প্রতিটি run byte-for-byte পুনরুত্পাদনযোগ্য থাকে.
এই মৌলিক উপাদানগুলোর কোনোটিই ঐচ্ছিক নয়. কার্যপরিধির উদ্দেশ্য হলো run শেষে reviewer-কে এমন কিছু দেওয়া যা তিনি সত্যিই অনুমোদন করতে পারেন: একটি বিজয়ী প্রার্থী, সীমাবদ্ধ diff, কী কী চেষ্টা করা হয়েছে তার পূর্ণ রেকর্ড এবং জানা খরচ. পাঁচটির যেকোনো একটি বাদ দিলে ওই নিশ্চয়তাগুলোর একটি হারিয়ে যায়.
তিনটি পরীক্ষাতেই একই হাইপোথিসিস স্ট্র্যাটেজি ব্যবহার করা হয়. প্রতিটি ধাপে (iteration), প্রপোজার বাজেট অনুযায়ী চালানো সম্ভব এমন পরিমাণের চেয়ে বেশি হাইপোথিসিস তৈরি করে: যেখানে ডিসপ্যাচ বাজেট হলো K = 8, সেখানে M = 8টি ক্যান্ডিডেট তৈরি করা হয়. এরপর একটি পৃথক LLM র্যাংকার মাত্র 30 সেকেন্ডের একটি একক কলে পুরো চিত্রটি সামনে রেখে সবকটি আটটি হাইপোথিসিসকে ক্রমানুসারে সাজায়: বর্তমান সেরা স্কোর ও এর দুর্বল দিকগুলো, সাম্প্রতিক ট্রায়ালগুলোর ব্যর্থতা বিশ্লেষণ এবং পাশাপাশি রাখা আটটি প্রস্তাবনা. শীর্ষ চারটি প্রস্তাবনা এক্সিকিউটরের কাছে পাঠানো হয়, যার প্রতিটিতে 15 থেকে 30 মিনিট সময় লাগে. বাকি চারটি প্রস্তাবনা কোনো রিসোর্স খরচের আগেই বাদ দিয়ে দেওয়া হয়.
ভিত্তির মডেলগুলো পুরো সময় স্থির রাখা হয়েছিল; কার্যপরিধি শুধু তাদের চারপাশের code সম্পাদনা করেছে. Signal Engine ও ডীপ রিসার্চ gpt-5.5-এ চলেছে. Agentic Multimodal Retrieval স্থানীয়ভাবে vLLM দিয়ে পরিবেশিত open-weight Qwen3.6-35B-A3B-এ চলেছে, সঙ্গে ছিল ColQwen3-4B image retriever; predictable on-prem cost-এর জন্য এই combination বেছে নেওয়া হয়েছে.
নিচের chart দেখায় আমাদের তিনটি প্রধান task-এ score কীভাবে বদলেছে. "Seed" হলো human engineer-এর লেখা starting code. "Meta-Harness" হলো Meta-Harness খুঁজে পাওয়া সেরা version. held-out test set-এ তিনটি task-এর সবগুলোর performance improvement আমরা দেখি.


Signal Engine freshness, factuality, granularity ও tone জুড়ে একটি LLM judge দিয়ে evaluated হয়েছে, 150 training tweet এবং 150 held-out test tweet ব্যবহার করে. Run চলাকালে best version training composite 0.431 থেকে 0.756 এবং held-out score 0.456 থেকে 0.841-এ উন্নত করেছে. উন্নতিগুলো শুধু প্রম্পট tweak নয়, কার্যপরিধি নিজেই বদলানোর ফল: বিজয়ী iteration-গুলো social-media noise filter করতে শিখেছে, fact-cross-checking step যোগ করেছে এবং প্রতিটি output-কে স্পষ্ট evidence-এ grounded করা বাধ্যতামূলক করেছে. নিচের diagram-এ iteration process দেখানো হয়েছে.


ট্রায়াল হিস্ট্রি থেকে দেখা যায় যে সেই উন্নতিগুলো কীভাবে একত্রিত হয়েছিল. একটি প্রাথমিক কাঠামোগত পরিবর্তন সর্বোচ্চ স্কোরকে 0.625-এ উন্নীত করেছিল; আরও সূক্ষ্ম প্রমাণ ব্যবস্থাপনা এটিকে 0.679-এ নিয়ে যায়; এবং একটি পরিমার্জিত রিফ্লেকশন-অ্যান্ড-রুব্রিক লুপ এটিকে 0.819-এ পৌঁছায়. প্রায় অর্ধেক ক্যান্ডিডেট রান প্রত্যাশিত পারফর্ম করতে পারেনি অথবা পুরোপুরি ব্যর্থ হয়েছে, তবে সেগুলো লিডারবোর্ডকে প্রভাবিত করেনি: প্রতিটি ফোর্ক আলাদাভাবে চলেছিল, অসফল পরিবর্তনগুলো বাদ দেওয়া হয়েছিল এবং ব্যর্থতার কারণগুলো রিফ্লেকশন স্টোরে নথিভুক্ত করা হয়েছিল যাতে পরবর্তী প্রপোজার একই ভুল বা অকার্যকর পথের পুনরাবৃত্তি না করে.
সবচেয়ে গুরুত্বপূর্ণ হলো, held-out curve পুরো run জুড়ে training curve-এর সঙ্গে সঙ্গে উঠেছে. এতে বোঝা যায় কার্যপরিধি training corpus মুখস্থ না করে workflow উন্নত করছিল. held-out score training score-এর চেয়ে সামান্য বেশি ছিল; এটিকে আমরা দুটি ছোট, disjoint split-এর সাধারণ sampling noise হিসেবে ব্যাখ্যা করি.
Agentic Multimodal Retrieval Public ViDoRe V3 Computer Science split-এ NDCG@10 দ্বারা পরিমাপ করা হয়, যা 20টি ট্রেনিং, দশটি ডেভেলপমেন্ট এবং 20টি পৃথক টেস্ট কুয়েরিতে বিন্যস্ত. এই হারনেসটি মূল ইভালুয়েশন সময় (wall-clock) 869 সেকেন্ড থেকে কমিয়ে মাত্র 54 সেকেন্ডে নিয়ে আসার পাশাপাশি টেস্ট NDCG@10-কে 0.705 থেকে 0.744-এ উন্নীত করেছে.
ডীপ রিসার্চ 10টি reference question জুড়ে DeepResearch-Eval অনুসরণ করে substantive quality ও reference quality-এর LLM-judged composite-এ graded হয়. উন্নত code mean 0.449 থেকে 0.802-এ তুলেছে. বিজয়ী পরিবর্তনগুলো diff থেকে সহজেই বোঝা গেছে: research এজেন্ট dispatch করার আগে approach তুলনা করা একটি upfront planning step এবং report আগে যেখানে খারাপ score করেছিল সেই dimension লক্ষ্য করা একটি final review step. এই set ছোট এবং evaluate করতে ব্যয়বহুল হওয়ায় আমরা এটি split করিনি, এবং result-টিকে in-sample হিসেবে ধরি.


আমরা একই বাজেটের অধীনে তিনটি পদ্ধতিই বেঞ্চমার্ক করেছি: একই ডেটাসেট, একই আন্ডারলাইয়িং মডেল, একই ইটারেশন ক্যাপ এবং ক্যান্ডিডেটদের মোট একই সংখ্যক মূল্যায়ন. Signal Engine-এ, হোল্ড-আউট টেস্টে Meta-Harness 0.841-এ পৌঁছেছে, যেখানে উভয় বেসলাইনই 0.50-এর নিচে ছিল. Agentic Multimodal Retrieval-এ, আমাদের টিম সর্বোচ্চ হোল্ড-আউট NDCG@10 অর্জন করেছে (CORAL-এর 0.700 এবং karpathy-এর 0.738-এর বিপরীতে 0.744) এবং অফিশিয়াল মূল্যায়ন 12 থেকে 14 গুণ দ্রুত পরিচালনা করে: 786s এবং 650s-এর বিপরীতে মাত্র 54s. ডীপ রিসার্চ-এ, আমাদের টিম 0.802-এ পৌঁছেছে, যেখানে উভয় বেসলাইনই প্রায় 0.52-এর কাছাকাছি ছিল. পুরো বিষয়টি জুড়েই একটি বিষয় প্রযোজ্য: আমরা CORAL এবং karpathy/autoresearch-কে তাদের প্রকাশিত বিবরণ থেকে পুনরায় ইমপ্লিমেন্ট করেছি, তাই এই পার্থক্যের কিছুটা অংশ কেবল পদ্ধতির পার্থক্যের বদলে ইমপ্লিমেন্টেশনের ভিন্নতাও প্রকাশ করতে পারে.
ডিজাইন সম্পর্কিত চারটি মূল সিদ্ধান্ত এই ব্যবধানের কারণ ব্যাখ্যা করে. প্রথমত, আমাদের টিম কোনো কোড সম্পাদন করার আগেই একটি সুসংগঠিত বা স্ট্রাকচার্ড ডিজাইন স্পেক তৈরি করে, যা প্রম্পটের সামান্য পরিবর্তনের পরিবর্তে নতুন পাইপলাইন স্টেজের মতো কাঠামোগত পরিবর্তনের দিকে বিষয়টিকে পরিচালিত করে. দ্বিতীয়ত, এটি একটি একক যৌথ ফ্রন্টিয়ার ক্যান্ডিডেটের ওপর ভিত্তি করে সমান্তরাল ফোর্ক পরিচালনা করে, যার ফলে CORAL-এর স্বাধীন এজেন্ট বা কার্পাথির কঠোর ধারাবাহিক লুপের চেয়ে উন্নয়নগুলো দ্রুত একত্রিত হয়. তৃতীয়ত, প্রতিটি ট্রায়াল কিছু স্ট্রাকচার্ড আর্টিফ্যাক্ট (স্কোর, ইভেন্ট লগ এবং LLM-এর তৈরি চারটি বিশ্লেষণ) তৈরি করে রেখে যায়, যা পরবর্তী প্রপোজার পড়ে পর্যবেক্ষণ করতে পারে; যেখানে বেসলাইনগুলো কেবল সাধারণ চেষ্টা সংক্রান্ত লগ রেখে দেয়. চতুর্থত, একটি অ্যাডাপ্টিভ কন্ট্রোলার কোনো স্থবিরতার পর প্রপোজারকে নতুন কিছু খোঁজার (exploration) দিকে এবং কোনো সাফল্যের পর পরিমার্জনের (refinement) দিকে চালিত করে, যার ওপর প্রেডিক্টিভ হাইপোথিসিস রির্যাংকিং অবস্থান করে দুর্বল আইডিয়াগুলোকে বাজেট ব্যবহারের আগেই বাদ দিয়ে দেয়.
হোল্ড-আউট কার্ভগুলো ইন-ডোমেইন জেনারেলাইজেশন প্রদর্শন করে, ক্রস-ডোমেইন ট্র্যান্সফার নয়: তাই হারনেস পুনরায় না চালিয়ে এআই-মার্কেট সিগন্যাল এক্সট্র্যাকশনের জন্য টিউন করা কোনো ওয়ার্কফ্লো লিগ্যাল বা বায়োমেডিকেল টেক্সটের ক্ষেত্রে কার্যকর হবে এমনটা আশা করা উচিত নয়. এছাড়া হারনেস কেবল গ্রেডারের নির্ধারিত দিকনির্দেশনা অনুসারেই এগোয়, তাই একটি ত্রুটিপূর্ণ ট্রেইনিং সেট বা ভুলভাবে ক্যালিব্রেট করা জাজ পুরোপুরি ওভারফিট হতে পারে; গম্ভীর কোনো রানের আগে আমরা অন্তত 20টি ভালোভাবে যাচাইকৃত ট্রেইনিং আইটেম এবং একটি পৃথক ডেভেলপমেন্ট স্প্লিট ব্যবহার করার পরামর্শ দিই. খরচই হলো সবচেয়ে বড় বাস্তব সীমাবদ্ধতা. প্রতিটি মূল্যায়ন পুরো স্প্লিটের বিপরীতে সম্পূর্ণ পাইপলাইন পুনরায় চালায়, শুধুমাত্র নির্বাচিত রিট্রিভাল ক্যান্ডিডেটই প্রায় 2.2 মিলিয়ন ইনপুট টোকেন খরচ করেছে এবং একটি gpt-5.5-ক্লাস মডেলে নিখুঁত অপটিমাইজেশন চালানো হলে প্রতি কাজের খরচ শত শত থেকে কয়েক হাজার ডলার পর্যন্ত হতে পারে. অবশেষে, এই সংখ্যাগুলো পুনরাবৃত্তি পরীক্ষার পরিবর্তে একক রান থেকে এসেছে, আর সে কারণেই আমরা এগুলোকে একটি আনুষ্ঠানিক গবেষণার বদলে একটি প্রকৌশল ব্লগ পোস্ট হিসেবে শেয়ার করছি.
Meta-Harness দেখায় যে স্বায়ত্তশাসিত কোড উন্নয়নকে এন্টারপ্রাইজ ব্যবহারের জন্য যথেষ্ট সুশৃঙ্খল করা সম্ভব. এর মূল উপাদানগুলো হলো কাঠামোগত হাইপোথিসিস, প্রেডিক্টিভ প্রি-ফিল্টারিং, আইসোলেটেড মূল্যায়ন, ডেটার সুযোগ থাকলে হেল্ড-আউট টেস্টিং এবং প্রতিটি গৃহীত পরিবর্তনের পেছনে একটি পূর্ণাঙ্গ অডিট ট্রেইল. এগুলো একত্রে একটি ইঞ্জিনিয়ারিং টিমকে একটি কার্যকর সিড পাইপলাইন থেকে পরিমাপযোগ্যভাবে উন্নত পাইপলাইনে পৌঁছানোর একটি পূর্বাভাসযোগ্য পথ দেয়, এবং একজন অপারেশনস ওনারকে একটি সহজ মডেল দেয়: কঠোর, বাজেট-সচেতন ফ্রেমওয়ার্কের ভেতরে সংরক্ষিত স্বায়ত্তশাসিত অনুসন্ধানের সুযোগ, যেখানে কোনো কিছু চালুর আগে নিয়োজিত থাকে মানুষের উপস্থিতি.