ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಸ್ವಾಯತ್ತ ಸುಧಾರಣಾ ವ್ಯವಸ್ಥೆಗಳು ಕೋಡಿಂಗ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಉತ್ತಮ ಫಲಿತಾಂಶ ತೋರಿಸಿವೆ. ಆದರೆ ನೈಜ ಉದ್ಯಮ ನಿಯೋಜನೆಗಳನ್ನು ಹೋಲುವ ಸಂಕೀರ್ಣ, ದೀರ್ಘಾವಧಿಯ AI ಕಾರ್ಯಪ್ರವಾಹಗಳನ್ನು ಅವು ಸುಧಾರಿಸಬಲ್ಲವೇ ಎಂಬುದು ಇನ್ನೂ ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ.
ನಮ್ಮ Meta-Harness ಸಂಶೋಧನೆಯು ಏಜೆಂಟಿಕ್ ರಿಟ್ರೀವಲ್, ಡೀಪ್ ರಿಸರ್ಚ್ ಮತ್ತು ಸಂಕೇತ ಗುಪ್ತಚರ ಕಾರ್ಯಪ್ರವಾಹಗಳಿಗೆ ಸ್ವಾಯತ್ತ ಸ್ವ-ಸುಧಾರಣೆಯನ್ನು ಅನ್ವಯಿಸುತ್ತದೆ. ಜೊತೆಗೆ ಪ್ರತ್ಯೇಕ ಮೌಲ್ಯಮಾಪನ, ಲೆಕ್ಕಪರಿಶೋಧನೀಯತೆ, ಬಜೆಟ್ ನಿಯಂತ್ರಣ ಮತ್ತು ಮಾನವ ಅನುಮೋದನೆಯಂತಹ ಉದ್ಯಮ ಅಗತ್ಯಗಳನ್ನು ಸೇರಿಸುತ್ತದೆ.
ಮೂರು ಪ್ರಾತಿನಿಧಿಕ ಕಾರ್ಯಭಾರಗಳಲ್ಲಿ Meta-Harness ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಗಣನೀಯವಾಗಿ ಹೆಚ್ಚಿಸಿದೆ. ಸಿಗ್ನಲ್ ಎಂಜಿನ್ನ ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಕಾರ್ಯಕ್ಷಮತೆಯಲ್ಲಿ 84% ಸುಧಾರಣೆ ಮತ್ತು ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ನಲ್ಲಿ ಹೆಚ್ಚಿನ ನಿಖರತೆಯೊಂದಿಗೆ 16 ಪಟ್ಟು ವೇಗದ ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆ ದೊರೆತಿವೆ.
ಹಿಂದಿನ ಹೆಚ್ಚಿನ ವಿಧಾನಗಳಿಗಿಂತ ಭಿನ್ನವಾಗಿ, ಸುಧಾರಣೆಗಳು ಆಪ್ಟಿಮೈಸೇಶನ್ಗೆ ಬಳಸಿದ ಡೇಟಾದಿಂದಾಚೆಗೆ ಅನ್ವಯವಾಗುತ್ತವೆಯೇ ಎಂದು ಅಳೆಯಲು Meta-Harness ಸಾಧ್ಯವಾದಲ್ಲೆಲ್ಲ ಪ್ರತ್ಯೇಕ ಡೇಟಾಸೆಟ್ಗಳ ಮೇಲೆ ಯಶಸ್ಸನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡುತ್ತದೆ.
ಸ್ವಾಯತ್ತ ಕಾರ್ಯಪ್ರವಾಹ ಸುಧಾರಣೆಯು ಕೋಡಿಂಗ್ ಮಾನದಂಡಗಳನ್ನು ಮೀರಿ ನೈಜ ಉದ್ಯಮ AI ವ್ಯವಸ್ಥೆಗಳಿಗೂ ವಿಸ್ತರಿಸಬಹುದು ಮತ್ತು ನಿರಂತರವಾಗಿ ಸುಧಾರಿಸುವ AI ಅನ್ವಯಗಳಿಗೆ ಪ್ರಾಯೋಗಿಕ ಮಾರ್ಗ ನೀಡಬಹುದು ಎಂಬುದನ್ನು ಈ ಫಲಿತಾಂಶಗಳು ಸೂಚಿಸುತ್ತವೆ.
Meta-Harness ಪ್ರಬಂಧ, CORAL ಚೌಕಟ್ಟು ಮತ್ತು karpathy/autoresearch ಸೇರಿದಂತೆ ಸ್ವಾಯತ್ತ AI ಸಂಶೋಧನೆಯ ಇತ್ತೀಚಿನ ಕೆಲಸವು, ಮೌಲ್ಯಮಾಪನ ಮಾನದಂಡವೊಂದನ್ನು ನೀಡಿದಾಗ ಕೋಡಿಂಗ್ ಏಜೆಂಟ್ಗಳು ಪರಿಹಾರವನ್ನು ಪುನರಾವರ್ತಿತವಾಗಿ ಸುಧಾರಿಸಬಲ್ಲವು ಎಂದು ತೋರಿಸಿದೆ. ಆ ವಿಧಾನಗಳು ದೀರ್ಘಾವಧಿಯ AI ಕಾರ್ಯಪ್ರವಾಹಗಳಿಗೆ ಅನ್ವಯವಾಗುತ್ತವೆಯೇ ಎಂಬ ಪ್ರಶ್ನೆ ಇನ್ನೂ ತೆರೆದಿದೆ. ಉದಾಹರಣೆಗೆ, ಏಜೆಂಟ್ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸಲು ಬಹುವಿಧ ಮಾಧ್ಯಮದ ವಿಷಯ ದತ್ತಸಂಗ್ರಹಗಳನ್ನು ಪುನರಾವರ್ತಿತವಾಗಿ ಹುಡುಕಬೇಕಾದ ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ ಅಥವಾ ಪರಸ್ಪರ ಅವಲಂಬಿತ ಅನೇಕ ಹಂತಗಳು, ಸಾಧನ ಕರೆಗಳು ಮತ್ತು ಅಪವಾದ ನಿರ್ವಹಣೆಯ ನಿರ್ಧಾರಗಳು ಬೇಕಾದ ಸಂಕೀರ್ಣ ದತ್ತಾಂಶ ಸಂಸ್ಕರಣಾ ಪ್ರಕ್ರಿಯೆಗಳು. ಆಪ್ಟಿಮೈಸರ್ ಎಂದಿಗೂ ನೋಡದ ಡೇಟಾದಲ್ಲೂ ಈ ಸುಧಾರಣೆಗಳು ಉಳಿಯುತ್ತವೆಯೇ ಎಂಬುದು ಇನ್ನೂ ಆಳವಾದ ಪ್ರಶ್ನೆ.
ನಮ್ಮ Meta-Harness ಸಂಶೋಧನೆ ಮತ್ತು ಅಭಿವೃದ್ಧಿಯೇ ಆ ಪ್ರಶ್ನೆಗೆ ನಮ್ಮ ಉತ್ತರ. ಇದು ಇತ್ತೀಚಿನ ಸಂಶೋಧನೆಯ ವಿಚಾರಗಳನ್ನು ಉದ್ಯಮದ ಅಗತ್ಯಗಳಿಗೆ ತಕ್ಕಂತೆ ಮರುರೂಪಿಸುತ್ತದೆ: ಪ್ರತ್ಯೇಕ ಮೌಲ್ಯಮಾಪನ, ಲೆಕ್ಕಪರಿಶೋಧನಾ ಜಾಡುಗಳು, ವೆಚ್ಚದ ಗರಿಷ್ಠ ಮಿತಿಗಳು ಮತ್ತು ಏನನ್ನಾದರೂ ಬಿಡುಗಡೆ ಮಾಡುವ ಮೊದಲು ಮಾನವ ಪರಿಶೀಲಕರಿಗೆ ಹಸ್ತಾಂತರಿಸುವ ಸ್ಪಷ್ಟ ಹಂತ.
ನೈಜ ಗ್ರಾಹಕರ ಕೆಲಸವನ್ನು ಆಧರಿಸಿದ ಮೂರು ದೀರ್ಘಾವಧಿಯ ಕಾರ್ಯಗಳಲ್ಲಿ ನಾವು ಇದನ್ನು ಪರೀಕ್ಷಿಸಿದ್ದೇವೆ. ಸಿಗ್ನಲ್ ಎಂಜಿನ್ AI ಮಾರುಕಟ್ಟೆಯ ಕುರಿತ X ಪೋಸ್ಟ್ಗಳ ನೇರ ಹರಿವನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡಿ, ಆಧಾರಸಹಿತ ಮತ್ತು ರಚನಾತ್ಮಕ ಪ್ರವೃತ್ತಿ ವರದಿಗಳನ್ನು ಸಿದ್ಧಪಡಿಸುತ್ತದೆ. ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ ಪಠ್ಯ ಮತ್ತು ಚಿತ್ರಗಳು ಬೆರೆತ ಪ್ರಶ್ನೆಗಳನ್ನು ವಿಶ್ಲೇಷಿಸಿ ಅತ್ಯಂತ ಸೂಕ್ತವಾದ ದಾಖಲೆಯ ಪುಟಗಳನ್ನು ನೀಡುತ್ತದೆ. ಡೀಪ್ ರಿಸರ್ಚ್ ಜಾಲವನ್ನು ಹುಡುಕಲು, ಮೂಲಗಳನ್ನು ಪರಸ್ಪರ ಪರಿಶೀಲಿಸಲು ಮತ್ತು ವಿಸ್ತೃತ ಸಂಶೋಧನಾ ವರದಿಗಳನ್ನು ಬರೆಯಲು ಅನೇಕ ಏಜೆಂಟ್ಗಳನ್ನು ಸಂಯೋಜಿಸುತ್ತದೆ.
ಸಿಗ್ನಲ್ ಎಂಜಿನ್: ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷೆಯ ಕಾಂಪೊಸಿಟ್ 0.456 → 0.841, ಅಂದರೆ ಸಾಪೇಕ್ಷವಾಗಿ 84% ಏರಿಕೆ. ಅದೇ ಬಜೆಟ್ನಲ್ಲಿ CORAL ಮತ್ತು karpathy/autoresearch ಎರಡೂ 0.50ಕ್ಕಿಂತ ಕೆಳಗೇ ಉಳಿದವು.
ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್: ಪ್ರತ್ಯೇಕ NDCG@10 ಅಂಕ 0.705 → 0.744 ಮತ್ತು ಪ್ರತಿ ಮೌಲ್ಯಮಾಪನದ ಒಟ್ಟು ಅವಧಿ 869 ಸೆಕೆಂಡುಗಳಿಂದ 54 ಸೆಕೆಂಡುಗಳಿಗೆ ಇಳಿಕೆ. ಇದು ಹೆಚ್ಚಿನ ನಿಖರತೆಯೊಂದಿಗೆ 16× ವೇಗವರ್ಧನೆ.
ಡೀಪ್ ರಿಸರ್ಚ್: 10 ಉಲ್ಲೇಖ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ವರದಿ ಗುಣಮಟ್ಟದ ಕಾಂಪೊಸಿಟ್ 0.449 → 0.802; ಮೂಲ ವಿಧಾನಗಳ ಅಂಕ ಸುಮಾರು 0.52. ಈ ಕಾರ್ಯದಲ್ಲಿ ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ವಿಭಜನೆ ಇರಲಿಲ್ಲ. ಆದ್ದರಿಂದ ಈ ಸಂಖ್ಯೆಯನ್ನು ಮಾದರಿಯೊಳಗಿನ ಫಲಿತಾಂಶವೆಂದು ಮಾತ್ರ ಪರಿಗಣಿಸುತ್ತೇವೆ.
ಹುಡುಕಾಟದ ದಕ್ಷತೆ: ಮುನ್ಸೂಚಕ ಊಹನೆ ಮರುಶ್ರೇಯಾಂಕದೊಂದಿಗೆ, ಅದೇ ಮೌಲ್ಯಮಾಪನ ಬಜೆಟ್ನಲ್ಲಿ ಸಿಗ್ನಲ್ ಎಂಜಿನ್ 20ರ ಬದಲು 3 ಪುನರಾವರ್ತನೆಗಳಲ್ಲಿ ಉಲ್ಲೇಖ ಪ್ರಕ್ರಿಯೆಯ ಅತ್ಯುತ್ತಮ ಅಂಕದ 91% ತಲುಪಿತು.
ಹೆಚ್ಚಿನ ಸ್ವಾಯತ್ತ ಸಂಶೋಧನಾ ವ್ಯವಸ್ಥೆಗಳು ಒಂದೇ ಡೇಟಾಸೆಟ್ನಲ್ಲಿ ಆಪ್ಟಿಮೈಸ್ ಮಾಡಿ ಮೌಲ್ಯಮಾಪನ ನಡೆಸುತ್ತವೆ. ಹೀಗಾಗಿ ಫಲಿತಾಂಶವು ಸಾಮಾನ್ಯೀಕರಿಸುತ್ತದೆಯೇ ಎಂದು ತಿಳಿಯಲು ಸಾಧ್ಯವಾಗುವುದಿಲ್ಲ. ಸಿಗ್ನಲ್ ಎಂಜಿನ್ ಮತ್ತು ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ಗಾಗಿ ನಾವು ಕಟ್ಟುನಿಟ್ಟಾದ ವಿಭಜನೆಯನ್ನು ಜಾರಿಗೊಳಿಸಿದ್ದೇವೆ: ಅಭ್ಯರ್ಥಿಗಳು ಅಂಕ ಪಡೆಯಬಹುದಾದ ತರಬೇತಿ ಸಮೂಹ, ಸಮಂಜಸತೆ ಪರಿಶೀಲನೆಗಾಗಿ ಅಭಿವೃದ್ಧಿ ಸಮೂಹ ಮತ್ತು ಆಪ್ಟಿಮೈಸರ್ ಎಂದಿಗೂ ನೋಡದ ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಸಮೂಹ. ವರದಿ ಮಾಡಿದ ಪ್ರತಿಯೊಂದು ಫಲಿತಾಂಶವೂ ಎಲ್ಲ ವಿಭಜನೆಗಳಲ್ಲಿ ಅಂಕ ಪಡೆದ ಒಂದೇ ನಿರ್ದಿಷ್ಟ ಕೋಡ್ ಆವೃತ್ತಿಯಿಂದ ಬಂದಿದೆ. ಹೀಗಾಗಿ ಒಬ್ಬ ಅಭ್ಯರ್ಥಿಯ ಅತ್ಯುತ್ತಮ ತರಬೇತಿ ಅಂಕವನ್ನು ಮತ್ತೊಬ್ಬರ ಅತ್ಯುತ್ತಮ ಪರೀಕ್ಷಾ ಅಂಕದೊಂದಿಗೆ ಎಂದಿಗೂ ಬೆರೆಸುವುದಿಲ್ಲ.
ಪ್ರತಿ ಸುತ್ತಿನಲ್ಲೂ, ಕೋಡ್ ಬದಲಾವಣೆಗೆ ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ರಚನಾತ್ಮಕ ಊಹನೆಗಳ ಗುಚ್ಛವನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಪ್ರತಿ ಊಹನೆಯೂ ತಾನು ಬದಲಿಸಲು ಉದ್ದೇಶಿಸಿದ ಕಾರ್ಯವಿಧಾನ, ಆಧರಿಸಿರುವ ಹಿಂದಿನ ಆವೃತ್ತಿ ಮತ್ತು ಗುರಿಯಾಗಿಸಿರುವ ವೈಫಲ್ಯದ ಸ್ವರೂಪವನ್ನು ಹೆಸರಿಸುತ್ತದೆ. ದುಬಾರಿ ಮೌಲ್ಯಮಾಪನಗಳನ್ನು ನಡೆಸುವ ಮೊದಲೇ ಶ್ರೇಯಾಂಕ ಹಂತವು ಗುಚ್ಛವನ್ನು ಶೋಧಿಸುತ್ತದೆ. ಉಳಿದ ಊಹನೆಗಳು ಸಾಮಾನ್ಯ ಜ್ಞಾನಕೋಶವನ್ನು ಹಂಚಿಕೊಳ್ಳುವ ಸಮಾನಾಂತರ ಕಾರ್ಯನಿರ್ವಾಹಕ ಏಜೆಂಟ್ಗಳಿಗೆ ಹೋಗುತ್ತವೆ. ಆದರೆ ಅವು ಸಂಪೂರ್ಣವಾಗಿ ಪ್ರತ್ಯೇಕಿಸಿದ ವರ್ಕ್ಸ್ಪೇಸ್ಗಳಲ್ಲಿ ಕೋಡ್ ಎಡಿಟ್ ಮಾಡುವುದರಿಂದ ಪ್ರತಿ ಅಭ್ಯರ್ಥಿಯನ್ನೂ ನ್ಯಾಯಯುತವಾಗಿ ಮತ್ತು ಸ್ವತಂತ್ರವಾಗಿ ಅಳೆಯಲಾಗುತ್ತದೆ. ಸುತ್ತಿನ ಕೊನೆಯಲ್ಲಿ, ಗೋಚರ ವಿಭಜನೆಗಳ ಎಲ್ಲ ಪರಿಶೀಲನೆಗಳನ್ನೂ ಪೂರೈಸಿದ ಅತ್ಯಧಿಕ ಅಂಕದ ಅಭ್ಯರ್ಥಿಯನ್ನು ಕಾರ್ಯನಿರ್ವಾಹಕವು ವಿಜೇತನಾಗಿ ಆಯ್ಕೆ ಮಾಡುತ್ತದೆ. ಆ ವಿಜೇತ ಆವೃತ್ತಿಯೇ ಮುಂದಿನ ಸುತ್ತಿನ ಅತ್ಯಾಧುನಿಕ ಆಧಾರವಾಗುತ್ತದೆ. ಪ್ರತಿ ಪ್ರಯೋಗವೂ ಬದಲಿಸಲಾಗದ ಸಾಕ್ಷ್ಯ ಸಂಗ್ರಹದಲ್ಲಿ ನಿಗದಿತ ಮಾಹಿತಿಯನ್ನು ಬರೆಯುತ್ತದೆ: ಅದರ ಕೋಡ್ ತಿದ್ದುಪಡಿ, ಪ್ರತಿ ವಿಭಜನೆಯ ಅಂಕಗಳು, ಘಟನೆ ದಾಖಲೆ ಮತ್ತು ಅದರ ಜಾಡು, ದೋಷಗಳು, ವೆಚ್ಚ ಹಾಗೂ ಆತ್ಮಾವಲೋಕನವನ್ನು ಒಳಗೊಂಡ ನಾಲ್ಕು ಸಂಕ್ಷಿಪ್ತ LLM ವಿಶ್ಲೇಷಣೆಗಳು. ಮುಂದಿನ ಸುತ್ತಿನ ಪ್ರಸ್ತಾಪಕವು ಈ ಇತಿಹಾಸವನ್ನು ಓದುತ್ತದೆ. ಹೀಗಾಗಿ ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಅದೇ ವಿಫಲ ಮಾರ್ಗಗಳನ್ನು ಮತ್ತೆ ಪ್ರಯತ್ನಿಸದೆ ಕಲಿತದ್ದನ್ನು ಒಟ್ಟುಗೂಡಿಸುತ್ತದೆ.


ಮೂರು ಸುರಕ್ಷತಾ ನಿಯಮಗಳು ಈ ಲೂಪ್ ಸುರಕ್ಷಿತವಾಗಿ ರನ್ ಆಗಲು ನೆರವಾಗುತ್ತವೆ. ವ್ಯಾಪ್ತಿ ನೀತಿಯು ಅಭ್ಯರ್ಥಿ ಬದಲಿಸಬಹುದಾದ ಕಡತಗಳನ್ನು ಸೀಮಿತಗೊಳಿಸುತ್ತದೆ ಮತ್ತು ವ್ಯಾಪ್ತಿಯ ಹೊರಗಿನ ಎಲ್ಲ ಬದಲಾವಣೆಗಳನ್ನು ಹಿಂತಿರುಗಿಸುತ್ತದೆ. ಟೋಕನ್ ಮತ್ತು ಒಟ್ಟು ಅವಧಿಯ ಮಿತಿಗಳು ವೆಚ್ಚವು ಗರಿಷ್ಠ ಮಿತಿಯನ್ನು ದಾಟಿದಾಗ ಪ್ರಕ್ರಿಯೆಯನ್ನು ನಿಲ್ಲಿಸುತ್ತವೆ. ಸಮಕಾಲಿಕತೆಯ ಮಿತಿಗಳು ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಮಾಡೆಲ್ ಮತ್ತು GPU ಬಳಕೆಯ ದರಮಿತಿಗಳೊಳಗೆ ಇರಿಸುತ್ತವೆ. ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಸ್ವತಃ ಯಾವುದನ್ನೂ ಬಿಡುಗಡೆ ಮಾಡುವುದಿಲ್ಲ. ಅದು ಶ್ರೇಯಾಂಕಿತ ಮತ್ತು ಸಂಪೂರ್ಣ ದಾಖಲೀಕೃತ ಅಭ್ಯರ್ಥಿಯನ್ನು ಒದಗಿಸುತ್ತದೆ. ಮಾನವ ಎಂಜಿನಿಯರ್ ವ್ಯತ್ಯಾಸವನ್ನು ಪರಿಶೀಲಿಸಿ ಅದನ್ನು ಉತ್ಪಾದನೆಗೆ ಕಳುಹಿಸಬೇಕೇ ಎಂದು ನಿರ್ಧರಿಸುತ್ತಾರೆ.
ಸ್ಥಳೀಯ ತಂತ್ರಾಂಶ ವ್ಯವಸ್ಥೆಯಲ್ಲಿ, ಮೇಲಿನ ಲೂಪ್ ಪ್ರತಿ ಸುತ್ತಿಗೂ ಐದು ಎಂಜಿನಿಯರಿಂಗ್ ಮೂಲಾಂಶಗಳು ಆಧಾರವಾಗಿವೆ.
ವರ್ಕ್ಸ್ಪೇಸ್ ಪ್ರತ್ಯೇಕತೆ. ಪ್ರತಿ ಅಭ್ಯರ್ಥಿಗೆ ಒಂದು git ಕಾರ್ಯವೃಕ್ಷ. ಫೋರ್ಕ್ ಮಾಡಿದ ಆವೃತ್ತಿಗಳು ವಸ್ತು ಡೇಟಾಬೇಸ್ ಅನ್ನು ಹಂಚಿಕೊಳ್ಳುತ್ತವೆ, ಆದರೆ ಪರಸ್ಪರರ ಫೈಲ್ಗಳನ್ನಲ್ಲ. ಇದರಿಂದ ಬಹುತೇಕ ಸ್ಥಿರ ಡಿಸ್ಕ್ ವೆಚ್ಚದಲ್ಲಿ ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಸಮಾನಾಂತರವಾಗಿ ನಡೆಸಬಹುದು ಮತ್ತು ಪ್ರಸ್ತುತ ಅತ್ಯಾಧುನಿಕ ಆವೃತ್ತಿಯೊಂದಿಗೆ ವ್ಯತ್ಯಾಸ ಗುರುತಿಸುವುದು ಸುಲಭವಾಗುತ್ತದೆ.
ಕಾರ್ಯಗತಗೊಳಿಸುವಿಕೆ ಸಂರಕ್ಷಿತ ಪರಿಸರ. ಸಂರಚನೆಯ ಮೂಲಕ ಅವಳಿ ವಿಧಾನಗಳು: ತ್ವರಿತ ಪುನರಾವರ್ತನೆಗೆ ಸ್ಥಳೀಯ ಉಪಪ್ರಕ್ರಿಯೆ ಅಥವಾ ಸಂಪೂರ್ಣವಾಗಿ ಪ್ರತ್ಯೇಕಿಸಿದ ಕಾರ್ಯಾಚರಣಾ ಪರಿಸರ. ದತ್ತಸಂಗ್ರಹಗಳನ್ನು ಓದಲು ಮಾತ್ರ ಸಾಧ್ಯವಾಗುವಂತೆ ಜೋಡಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಪ್ರತಿ ಪ್ರಯೋಗದ ತಾತ್ಕಾಲಿಕ ಕೋಶವನ್ನು ಅಂಕ ನೀಡಿದ ನಂತರ ಅಳಿಸಲಾಗುತ್ತದೆ. ಹೀಗಾಗಿ ಪ್ರಯೋಗವು ಡೇಟಾಸೆಟ್ ಅನ್ನು ಬದಲಿಸಲು ಅಥವಾ ತನ್ನ ಸ್ಥಿತಿಯನ್ನು ಮುಂದಿನ ಪ್ರಯೋಗಕ್ಕೆ ಸೋರಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.
ವ್ಯಾಪ್ತಿ ನೀತಿ. ಪ್ರಯೋಗದ ಸಂರಚನೆಯಲ್ಲಿ ಘೋಷಿಸಿದ ಅನುಮತಿಸಲಾದ ಪಥಗಳ ಪಟ್ಟಿ. ಅದರ ಹೊರಗೆ ಬದಲಿಸಿದ ಎಲ್ಲವನ್ನೂ ಪ್ರಯೋಗಕ್ಕೆ ಅಂಕ ನೀಡುವ ಮೊದಲು ಹಿಂತಿರುಗಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಪ್ರಯೋಗವನ್ನು ಗುರುತು ಮಾಡಲಾಗುತ್ತದೆ. ಆದ್ದರಿಂದ ಪರಿಶೀಲಕರು ನೋಡುವ ವ್ಯತ್ಯಾಸವು ಘೋಷಿಸಿದ ವ್ಯಾಪ್ತಿಯೊಳಗೇ ಇರುತ್ತದೆ ಎಂಬ ಖಾತರಿ ದೊರೆಯುತ್ತದೆ.
ಬಜೆಟ್ ಜಾರಿ. ಮೂರು ಹಂತಗಳು: ಪ್ರತಿ ಪ್ರಯೋಗದ ಟೋಕನ್ ಮತ್ತು ಅವಧಿ ಮಿತಿಗಳು, ಪ್ರತಿ ಪ್ರಕ್ರಿಯೆಯ ಒಟ್ಟು ಗರಿಷ್ಠ ಮಿತಿ ಮತ್ತು ಸಮಕಾಲಿಕತೆಯ ಮಿತಿ. ಇವು ಒಟ್ಟಾಗಿ ವೆಚ್ಚವನ್ನು ಊಹಿಸಬಹುದಾದ ಮಟ್ಟದಲ್ಲಿರಿಸಿ, ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಮಾಡೆಲ್ ಮತ್ತು ಮೂಲಸೌಕರ್ಯದ ಬಳಕೆಯ ದರಮಿತಿಗಳೊಳಗೆ ಇರುವುದನ್ನು ಖಚಿತಪಡಿಸುತ್ತವೆ.
ಸಾಕ್ಷ್ಯ ಸಂಗ್ರಹ. ಕೋಡ್ ತಿದ್ದುಪಡಿ, ಪ್ರತಿ ವಿಭಜನೆಯ ಅಂಕಗಳು, ಘಟನೆ ದಾಖಲೆ ಮತ್ತು LLM ಬರೆದ ನಾಲ್ಕು ವಿಶ್ಲೇಷಣೆಗಳನ್ನು ಸೇರಿಸುತ್ತಾ ಮಾತ್ರ ಹೋಗುವ JSONL ಕಡತ. ಪ್ರತಿ ಪ್ರಯೋಗದ ನಂತರ ಸಿದ್ಧಪಡಿಸಿದ ನೋಟಗಳು (ಶ್ರೇಯಾಂಕ ಪಟ್ಟಿ, ಅತ್ಯಾಧುನಿಕ ಆವೃತ್ತಿ ಮತ್ತು ವೈಫಲ್ಯ ಸೂಚಿ) ಮರುಸೃಷ್ಟಿಯಾಗುತ್ತವೆ. ಇದರಿಂದ ನಂತರದ ಸುತ್ತುಗಳು ಹಿಂದಿನ ಇತಿಹಾಸದ ಮೇಲೆ ನಿರ್ಮಾಣವಾಗುತ್ತವೆ ಮತ್ತು ಪ್ರತಿ ಪ್ರಕ್ರಿಯೆಯನ್ನೂ ಬೈಟ್ಗಟ್ಟಲೆ ಮರುಸೃಷ್ಟಿಸಬಹುದು.
ಈ ಮೂಲಾಂಶಗಳಲ್ಲಿ ಯಾವುದೂ ಐಚ್ಛಿಕವಲ್ಲ. ಪ್ರಕ್ರಿಯೆಯ ಕೊನೆಯಲ್ಲಿ ಪರಿಶೀಲಕರು ನಿಜವಾಗಿಯೂ ಅನುಮೋದಿಸಬಹುದಾದುದನ್ನು ಒದಗಿಸುವುದೇ ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ಉದ್ದೇಶ: ವಿಜೇತ ಅಭ್ಯರ್ಥಿ, ಮಿತಿಯೊಳಗಿನ ವ್ಯತ್ಯಾಸ, ಪ್ರಯತ್ನಿಸಿದ ಎಲ್ಲದರ ಸಂಪೂರ್ಣ ದಾಖಲೆ ಮತ್ತು ತಿಳಿದಿರುವ ವೆಚ್ಚ. ಈ ಐದರಲ್ಲಿ ಯಾವುದನ್ನಾದರೂ ತೆಗೆದುಹಾಕಿದರೆ, ಆ ಖಾತರಿಗಳಲ್ಲಿ ಒಂದು ಕಣ್ಮರೆಯಾಗುತ್ತದೆ.
ಮೂರೂ ಪ್ರಯೋಗಗಳು ಒಂದೇ ಪರಿಕಲ್ಪನಾ ತಂತ್ರವನ್ನು ಬಳಸುತ್ತವೆ. ಪ್ರತಿ ಪುನರಾವರ್ತನೆಯಲ್ಲೂ ಪ್ರಸ್ತಾಪಕವು ಬಜೆಟ್ನಿಂದ ನಡೆಸಲು ಸಾಧ್ಯವಾಗುವುದಕ್ಕಿಂತ ಹೆಚ್ಚು ಪರಿಕಲ್ಪನೆಗಳನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ: K = 4 ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಕಳುಹಿಸುವ ಬಜೆಟ್ಗೆ M = 8 ಅಭ್ಯರ್ಥಿಗಳು. ನಂತರ ಪ್ರತ್ಯೇಕ LLM ಶ್ರೇಯಾಂಕಕಾರವು ಮೂವತ್ತು ಸೆಕೆಂಡಿನ ಒಂದೇ ಕರೆಯಲ್ಲಿ ಎಲ್ಲ 8 ಅಭ್ಯರ್ಥಿಗಳನ್ನು ಕ್ರಮಗೊಳಿಸುತ್ತದೆ. ಅದರ ಮುಂದೆ ಪ್ರಸ್ತುತ ಅತ್ಯುತ್ತಮ ಅಂಕ ಮತ್ತು ಅದರ ದುರ್ಬಲ ಆಯಾಮಗಳು, ಇತ್ತೀಚಿನ ಪ್ರಯೋಗಗಳ ವೈಫಲ್ಯ ವಿಶ್ಲೇಷಣೆಗಳು ಹಾಗೂ ಎಲ್ಲ 8 ಪ್ರಸ್ತಾವನೆಗಳು ಪಕ್ಕಪಕ್ಕದಲ್ಲಿರುತ್ತವೆ. ಅಗ್ರ 4 ಅಭ್ಯರ್ಥಿಗಳು ಕಾರ್ಯಗತಗೊಳಿಸುವ ವ್ಯವಸ್ಥೆಗೆ ಹೋಗುತ್ತವೆ ಮತ್ತು ಪ್ರತಿಯೊಂದಕ್ಕೂ 15ರಿಂದ 30 ನಿಮಿಷ ಬೇಕಾಗುತ್ತದೆ. ಉಳಿದ 4 ಅಭ್ಯರ್ಥಿಗಳು ಯಾವುದೇ ವೆಚ್ಚ ಮಾಡುವ ಮೊದಲೇ ಕೈಬಿಡಲ್ಪಡುತ್ತವೆ.
ಆಧಾರವಾಗಿರುವ ಮಾಡೆಲ್ಗಳನ್ನು ಎಲ್ಲೆಡೆಯೂ ಬದಲಿಸದೆ ಇಡಲಾಯಿತು. ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಅವುಗಳ ಸುತ್ತಲಿನ ಕೋಡ್ನ್ನು ಮಾತ್ರ ಸಂಪಾದಿಸಿತು. ಸಿಗ್ನಲ್ ಎಂಜಿನ್ ಮತ್ತು ಡೀಪ್ ರಿಸರ್ಚ್ gpt-5.5ನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿದವು. ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್, vLLM ಮೂಲಕ ಸ್ಥಳೀಯವಾಗಿ ಒದಗಿಸಿದ ಮುಕ್ತ ತೂಕಗಳ Qwen3.6-35B-A3Bನಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು. ಇದನ್ನು ColQwen3-4B ಚಿತ್ರ ಮರುಪಡೆಯುವ ವ್ಯವಸ್ಥೆಯೊಂದಿಗೆ ಜೋಡಿಸಲಾಗಿತ್ತು. ಆಂತರಿಕ ಮೂಲಸೌಕರ್ಯದಲ್ಲಿ ಊಹಿಸಬಹುದಾದ ವೆಚ್ಚಕ್ಕಾಗಿ ಈ ಸಂಯೋಜನೆಯನ್ನು ಆಯ್ಕೆ ಮಾಡಲಾಯಿತು.
ನಮ್ಮ ಮೂರು ಮುಖ್ಯ ಕಾರ್ಯಗಳ ಅಂಕಗಳು ಹೇಗೆ ಬದಲಾದವು ಎಂಬುದನ್ನು ಕೆಳಗಿನ ಪಟ್ಟಿಕೆ ತೋರಿಸುತ್ತದೆ. “Seed” ಎಂದರೆ ಮಾನವ ಎಂಜಿನಿಯರ್ ಬರೆದ ಆರಂಭಿಕ ಕೋಡ್. “Meta-Harness” ಎಂದರೆ Meta-Harness ಕಂಡುಕೊಂಡ ಅತ್ಯುತ್ತಮ ಆವೃತ್ತಿ. ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಸಮೂಹದಲ್ಲಿ ಮೂರೂ ಕಾರ್ಯಗಳ ಕಾರ್ಯಕ್ಷಮತೆ ಸುಧಾರಿಸಿರುವುದನ್ನು ನಾವು ಕಾಣುತ್ತೇವೆ.


ಸಿಗ್ನಲ್ ಎಂಜಿನ್ ಅನ್ನು ತಾಜಾತನ, ವಾಸ್ತವಿಕತೆ, ವಿವರಮಟ್ಟ ಮತ್ತು ಧಾಟಿಯ ಆಧಾರದಲ್ಲಿ LLM ನಿರ್ಣಾಯಕವು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿತು. ಇದಕ್ಕಾಗಿ 150 ತರಬೇತಿ ಟ್ವೀಟ್ಗಳು ಮತ್ತು 150 ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಟ್ವೀಟ್ಗಳನ್ನು ಬಳಸಲಾಯಿತು. ಪ್ರಕ್ರಿಯೆಯ ಅವಧಿಯಲ್ಲಿ ಅತ್ಯುತ್ತಮ ಆವೃತ್ತಿಯ ತರಬೇತಿ ಕಾಂಪೊಸಿಟ್ 0.431ರಿಂದ 0.756ಕ್ಕೆ ಮತ್ತು ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಅಂಕವು 0.456ರಿಂದ 0.841ಕ್ಕೆ ಏರಿತು. ಈ ಸುಧಾರಣೆಗಳು ಕೇವಲ ಪ್ರಾಂಪ್ಟ್ ತಿದ್ದುಪಡಿಗಳಿಂದಲ್ಲ, ಪೂರಕ ವ್ಯವಸ್ಥೆಯ ಬದಲಾವಣೆಗಳಿಂದಲೇ ಬಂದವು. ವಿಜೇತ ಪುನರಾವರ್ತನೆಗಳು ಸಾಮಾಜಿಕ ಮಾಧ್ಯಮದ ಅನಗತ್ಯ ಮಾಹಿತಿಯನ್ನು ಶೋಧಿಸಲು ಕಲಿತವು, ವಾಸ್ತವಾಂಶಗಳ ಪರಸ್ಪರ ಪರಿಶೀಲನಾ ಹಂತಗಳನ್ನು ಸೇರಿಸಿದವು ಮತ್ತು ಪ್ರತಿ ಫಲಿತಾಂಶವೂ ಸ್ಪಷ್ಟ ಸಾಕ್ಷ್ಯವನ್ನು ಆಧರಿಸುವುದನ್ನು ಕಡ್ಡಾಯಗೊಳಿಸಿದವು. ಕೆಳಗಿನ ರೇಖಾಚಿತ್ರವು ಪುನರಾವರ್ತನೆಯ ಪ್ರಕ್ರಿಯೆಯನ್ನು ತೋರಿಸುತ್ತದೆ.


ಆ ಸುಧಾರಣೆಗಳು ಹೇಗೆ ಸಂಗ್ರಹವಾದವು ಎಂಬುದನ್ನು ಪ್ರಯೋಗದ ಇತಿಹಾಸ ತೋರಿಸುತ್ತದೆ. ಆರಂಭಿಕ ರಚನಾತ್ಮಕ ಬದಲಾವಣೆಯು ಆಗಿನ ಅತ್ಯುತ್ತಮ ಅಂಕವನ್ನು 0.625ಕ್ಕೆ ಏರಿಸಿತು. ಹೆಚ್ಚು ಸೂಕ್ಷ್ಮವಾದ ಸಾಕ್ಷ್ಯ ನಿರ್ವಹಣೆ ಅದನ್ನು 0.679ಕ್ಕೆ ತಲುಪಿಸಿತು. ಸುಧಾರಿತ ಆತ್ಮಾವಲೋಕನ ಮತ್ತು ಮಾನದಂಡದ ಚಕ್ರವು ಅದನ್ನು 0.819ಕ್ಕೆ ಏರಿಸಿತು. ಎಲ್ಲ ಅಭ್ಯರ್ಥಿ ಪ್ರಕ್ರಿಯೆಗಳಲ್ಲಿ ಸುಮಾರು ಅರ್ಧದಷ್ಟು ಕಳಪೆ ಫಲಿತಾಂಶ ನೀಡಿದವು ಅಥವಾ ಸಂಪೂರ್ಣವಾಗಿ ವಿಫಲವಾದವು. ಆದರೆ ಅವು ಶ್ರೇಯಾಂಕ ಪಟ್ಟಿಯನ್ನು ಕಲುಷಿತಗೊಳಿಸಲಿಲ್ಲ: ಪ್ರತಿ ಫೋರ್ಕ್ ಮಾಡಿದ ಆವೃತ್ತಿಯೂ ಪ್ರತ್ಯೇಕವಾಗಿ ನಡೆಯಿತು, ಸೋತ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಕೈಬಿಡಲಾಯಿತು ಮತ್ತು ಮುಂದಿನ ಪ್ರಸ್ತಾಪಕವು ಅದೇ ವಿಫಲ ಮಾರ್ಗವನ್ನು ಪುನರಾವರ್ತಿಸದಂತೆ ವೈಫಲ್ಯಗಳನ್ನು ಆತ್ಮಾವಲೋಕನ ಸಂಗ್ರಹದಲ್ಲಿ ಬರೆಯಲಾಯಿತು.
ಅತ್ಯಂತ ಮುಖ್ಯವಾಗಿ, ಪ್ರಕ್ರಿಯೆಯುದ್ದಕ್ಕೂ ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ವಕ್ರವು ತರಬೇತಿ ವಕ್ರದ ಜೊತೆಯಲ್ಲೇ ಏರಿತು. ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ತರಬೇತಿ ದತ್ತಸಂಗ್ರಹವನ್ನು ಕಂಠಪಾಠ ಮಾಡುವ ಬದಲು ಕಾರ್ಯಪ್ರವಾಹವನ್ನು ಸುಧಾರಿಸುತ್ತಿತ್ತು ಎಂಬುದನ್ನು ಇದು ಸೂಚಿಸುತ್ತದೆ. ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಅಂಕಗಳು ತರಬೇತಿ ಅಂಕಗಳಿಗಿಂತ ಸ್ವಲ್ಪ ಹೆಚ್ಚಿದ್ದವು. ಇದನ್ನು ಎರಡು ಸಣ್ಣ, ಪರಸ್ಪರ ಪ್ರತ್ಯೇಕ ವಿಭಜನೆಗಳ ನಡುವಿನ ಸಾಮಾನ್ಯ ಮಾದರಿ ಆಯ್ಕೆ ವ್ಯತ್ಯಾಸವೆಂದು ನಾವು ಅರ್ಥೈಸುತ್ತೇವೆ.
ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ ಅನ್ನು ಸಾರ್ವಜನಿಕ ViDoRe V3 ಕಂಪ್ಯೂಟರ್ ಸೈನ್ಸ್ ವಿಭಜನೆಯಲ್ಲಿ NDCG@10 ಮೂಲಕ ಅಳೆಯಲಾಗುತ್ತದೆ. ಅದನ್ನು 20 ತರಬೇತಿ, 10 ಅಭಿವೃದ್ಧಿ ಮತ್ತು 20 ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ಪ್ರಶ್ನೆಗಳಾಗಿ ವಿಂಗಡಿಸಲಾಗಿದೆ. ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಪ್ರತ್ಯೇಕ NDCG@10 ಅಂಕವನ್ನು 0.705ರಿಂದ 0.744ಕ್ಕೆ ಏರಿಸುವುದರ ಜೊತೆಗೆ ಮೌಲ್ಯಮಾಪನದ ಒಟ್ಟು ಅವಧಿಯನ್ನು 869 ಸೆಕೆಂಡುಗಳಿಂದ 54 ಸೆಕೆಂಡುಗಳಿಗೆ ಇಳಿಸಿತು.
ಡೀಪ್ ರಿಸರ್ಚ್ ಅನ್ನು 10 ಉಲ್ಲೇಖ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ, DeepResearch-Eval ಅನುಸರಿಸಿ, ವಿಷಯದ ಗುಣಮಟ್ಟ ಮತ್ತು ಉಲ್ಲೇಖಗಳ ಗುಣಮಟ್ಟದ LLM ನಿರ್ಣಯಿತ ಕಾಂಪೊಸಿಟ್ ಮೂಲಕ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಾಗಿದೆ. ಸುಧಾರಿತ ಕೋಡ್ ಸರಾಸರಿಯನ್ನು 0.449ರಿಂದ 0.802ಕ್ಕೆ ಏರಿಸಿತು. ವಿಜೇತ ಬದಲಾವಣೆಗಳು ವ್ಯತ್ಯಾಸದಲ್ಲೇ ಸುಲಭವಾಗಿ ಗೋಚರಿಸಿದವು: ಯಾವುದೇ ಸಂಶೋಧನಾ ಏಜೆಂಟ್ಗಳನ್ನು ಕಳುಹಿಸುವ ಮೊದಲು ವಿಧಾನಗಳನ್ನು ಹೋಲಿಸುವ ಆರಂಭಿಕ ಯೋಜನಾ ಹಂತ ಮತ್ತು ಹಿಂದಿನ ವರದಿಗಳು ಕಳಪೆ ಅಂಕ ಪಡೆದಿದ್ದ ಆಯಾಮಗಳನ್ನು ಗುರಿಯಾಗಿಸಿದ ಅಂತಿಮ ಪರಿಶೀಲನಾ ಹಂತ. ಈ ಸಮೂಹವು ಚಿಕ್ಕದಾಗಿದ್ದು ಮೌಲ್ಯಮಾಪನಕ್ಕೆ ದುಬಾರಿಯಾದ ಕಾರಣ, ನಾವು ಅದನ್ನು ವಿಭಜಿಸಲಿಲ್ಲ ಮತ್ತು ಫಲಿತಾಂಶವನ್ನು ಮಾದರಿಯೊಳಗಿನದ್ದೆಂದು ಪರಿಗಣಿಸುತ್ತೇವೆ.


ನಾವು ಮೂರೂ ವಿಧಾನಗಳನ್ನು ಒಂದೇ ಬಜೆಟ್ನಲ್ಲಿ ಹೋಲಿಸಿದ್ದೇವೆ: ಅದೇ ಡೇಟಾಸೆಟ್, ಅದೇ ಆಧಾರ ಮಾಡೆಲ್ಗಳು, ಅದೇ ಪುನರಾವರ್ತನೆ ಮಿತಿ ಮತ್ತು ಅದೇ ಒಟ್ಟು ಅಭ್ಯರ್ಥಿ ಮೌಲ್ಯಮಾಪನಗಳು. ಸಿಗ್ನಲ್ ಎಂಜಿನ್ನಲ್ಲಿ Meta-Harness ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷೆಯಲ್ಲಿ 0.841 ತಲುಪಿದರೆ, ಎರಡೂ ಮೂಲ ವಿಧಾನಗಳು 0.50ಕ್ಕಿಂತ ಕೆಳಗೇ ಉಳಿದವು. ಏಜೆಂಟಿಕ್ ಮಲ್ಟಿಮಾಡಲ್ ರಿಟ್ರೀವಲ್ನಲ್ಲಿ ನಮ್ಮ ತಂಡವು ಅತ್ಯಧಿಕ ಪ್ರತ್ಯೇಕ NDCG@10 ಅಂಕ ಹೊಂದಿದೆ: CORALಗೆ 0.700 ಮತ್ತು karpathyಗೆ 0.738 ಇದ್ದರೆ ನಮಗೆ 0.744. ಅಧಿಕೃತ ಮೌಲ್ಯಮಾಪನವನ್ನೂ 12ರಿಂದ 14 ಪಟ್ಟು ವೇಗವಾಗಿ ನಡೆಸುತ್ತದೆ: 786 ಮತ್ತು 650 ಸೆಕೆಂಡುಗಳಿಗೆ ಹೋಲಿಸಿದರೆ 54 ಸೆಕೆಂಡುಗಳು. ಡೀಪ್ ರಿಸರ್ಚ್ನಲ್ಲಿ ನಮ್ಮ ತಂಡ 0.802 ತಲುಪಿದರೆ, ಎರಡೂ ಮೂಲ ವಿಧಾನಗಳು 0.52ರ ಆಸುಪಾಸಿನಲ್ಲೇ ಉಳಿದವು. ಒಂದು ಎಚ್ಚರಿಕೆ ಎಲ್ಲೆಡೆ ಅನ್ವಯಿಸುತ್ತದೆ: ಪ್ರಕಟಿತ ವಿವರಣೆಗಳ ಆಧಾರದಲ್ಲಿ ನಾವು CORAL ಮತ್ತು karpathy/autoresearch ಅನ್ನು ಮರುಅನುಷ್ಠಾನಗೊಳಿಸಿದ್ದೇವೆ. ಆದ್ದರಿಂದ ವ್ಯತ್ಯಾಸದ ಒಂದು ಭಾಗವು ವಿಧಾನಗಳಿಗಿಂತ ಅನುಷ್ಠಾನದ ವ್ಯತ್ಯಾಸಗಳಿಂದ ಉಂಟಾಗಿರಬಹುದು.
ಈ ಅಂತರಕ್ಕೆ ನಾಲ್ಕು ವಿನ್ಯಾಸ ಆಯ್ಕೆಗಳು ಕಾರಣವಾಗಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಯಾವುದೇ ಕೋಡ್ ಎಡಿಟ್ ಮಾಡುವ ಮೊದಲು ನಮ್ಮ ತಂಡವು ರಚನಾತ್ಮಕ ವಿನ್ಯಾಸ ನಿರ್ದಿಷ್ಟತೆಯನ್ನು ಸೃಷ್ಟಿಸುತ್ತದೆ. ಇದರಿಂದ ಪ್ರಾಂಪ್ಟ್ ತಿದ್ದುಪಡಿಗಳ ಬದಲು ಹೊಸ ಪ್ರಕ್ರಿಯಾ ಹಂತಗಳಂತಹ ರಚನಾತ್ಮಕ ಬದಲಾವಣೆಗಳಿಗೆ ಆದ್ಯತೆ ಸಿಗುತ್ತದೆ. ಎರಡನೆಯದಾಗಿ, ಹಂಚಿಕೊಂಡ ಅತ್ಯಾಧುನಿಕ ಅಭ್ಯರ್ಥಿಯನ್ನು ಆಧರಿಸಿದ ಸಮಕಾಲೀನ ಫೋರ್ಕ್ಗಳನ್ನು ಇದು ನಡೆಸುತ್ತದೆ. ಹೀಗಾಗಿ CORALನ ಸ್ವತಂತ್ರ ಏಜೆಂಟ್ಗಳು ಅಥವಾ karpathyಯ ಕಟ್ಟುನಿಟ್ಟಾದ ಅನುಕ್ರಮ ಚಕ್ರಕ್ಕಿಂತ ವೇಗವಾಗಿ ಸುಧಾರಣೆಗಳು ಸಂಗ್ರಹವಾಗುತ್ತವೆ. ಮೂರನೆಯದಾಗಿ, ಪ್ರತಿ ಪ್ರಯೋಗವೂ ರಚನಾತ್ಮಕ ಫಲಿತಾಂಶಗಳನ್ನು ಉಳಿಸುತ್ತದೆ: ಅಂಕಗಳು, ಘಟನೆ ದಾಖಲೆಗಳು ಮತ್ತು LLM ಬರೆದ ನಾಲ್ಕು ವಿಶ್ಲೇಷಣೆಗಳು. ಮುಂದಿನ ಪ್ರಸ್ತಾಪಕವು ಇವುಗಳನ್ನು ಓದುತ್ತದೆ. ಮೂಲ ವಿಧಾನಗಳು ಪ್ರಯತ್ನಗಳ ಸರಳ ದಾಖಲೆಗಳನ್ನು ಮಾತ್ರ ಉಳಿಸುತ್ತವೆ. ನಾಲ್ಕನೆಯದಾಗಿ, ಹೊಂದಿಕೊಳ್ಳುವ ನಿಯಂತ್ರಕವು ಪ್ರಗತಿ ನಿಂತಾಗ ಪ್ರಸ್ತಾಪಕವನ್ನು ಅನ್ವೇಷಣೆಯತ್ತ ಮತ್ತು ಗೆಲುವಿನ ನಂತರ ಪರಿಷ್ಕರಣೆಯತ್ತ ಕೊಂಡೊಯ್ಯುತ್ತದೆ. ಜೊತೆಗೆ ಮುನ್ಸೂಚಕ ಪರಿಕಲ್ಪನೆ ಮರುಶ್ರೇಯಾಂಕವು ದುರ್ಬಲ ವಿಚಾರಗಳು ಬಜೆಟ್ ಬಳಸುವ ಮೊದಲೇ ಅವನ್ನು ಕೈಬಿಡುತ್ತದೆ.
ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷಾ ವಕ್ರಗಳು ಒಂದೇ ವಿಷಯಕ್ಷೇತ್ರದೊಳಗಿನ ಸಾಮಾನ್ಯೀಕರಣವನ್ನು ತೋರಿಸುತ್ತವೆ, ವಿಷಯಕ್ಷೇತ್ರಗಳ ನಡುವಿನ ವರ್ಗಾವಣೆಯನ್ನಲ್ಲ. AI ಮಾರುಕಟ್ಟೆಯ ಸಂಕೇತಗಳನ್ನು ಹೊರತೆಗೆಯಲು ಹೊಂದಿಸಿದ ಕಾರ್ಯಪ್ರವಾಹವು ಪೂರಕ ವ್ಯವಸ್ಥೆಯನ್ನು ಮತ್ತೆ ನಡೆಸದೆ ಕಾನೂನು ಅಥವಾ ಜೈವಿಕ ವೈದ್ಯಕೀಯ ಪಠ್ಯದಲ್ಲೂ ಸಮರ್ಪಕವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂದು ನಿರೀಕ್ಷಿಸಬಾರದು. ಪೂರಕ ವ್ಯವಸ್ಥೆಯು ಅಂಕ ನಿರ್ಣಾಯಕ ವ್ಯಾಖ್ಯಾನಿಸಿದ ಗುರಿಯತ್ತ ಮಾತ್ರ ಏರುತ್ತದೆ. ಆದ್ದರಿಂದ ಗದ್ದಲದ ತರಬೇತಿ ಸಮೂಹ ಅಥವಾ ಸರಿಯಾಗಿ ಮಾಪನಾಂಕ ಮಾಡದ ನಿರ್ಣಾಯಕಕ್ಕೆ ಅದು ನಿಷ್ಠೆಯಿಂದ ಅತಿಯಾಗಿ ಹೊಂದಿಕೊಳ್ಳುತ್ತದೆ. ಗಂಭೀರ ಪ್ರಕ್ರಿಯೆಯ ಮೊದಲು ಕನಿಷ್ಠ 20 ಉತ್ತಮವಾಗಿ ಆಯ್ದ ತರಬೇತಿ ಅಂಶಗಳು ಮತ್ತು ಪ್ರತ್ಯೇಕ ಅಭಿವೃದ್ಧಿ ವಿಭಜನೆಯನ್ನು ನಾವು ಶಿಫಾರಸು ಮಾಡುತ್ತೇವೆ. ವೆಚ್ಚವೇ ಅತಿದೊಡ್ಡ ಪ್ರಾಯೋಗಿಕ ನಿರ್ಬಂಧ. ಪ್ರತಿ ಮೌಲ್ಯಮಾಪನವೂ ಸಂಪೂರ್ಣ ವಿಭಜನೆಗಳಲ್ಲಿ ಇಡೀ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಮತ್ತೆ ನಡೆಸುತ್ತದೆ. ಆಯ್ಕೆಯಾದ ಮರುಪಡೆಯುವ ಅಭ್ಯರ್ಥಿಯೊಂದೇ ಸುಮಾರು 22 ಲಕ್ಷ ಇನ್ಪುಟ್ ಟೋಕನ್ಗಳನ್ನು ಬಳಸಿತು. gpt-5.5 ವರ್ಗದ ಮಾಡೆಲ್ನಲ್ಲಿ ಗಂಭೀರ ಆಪ್ಟಿಮೈಸೇಶನ್ಗೆ ಪ್ರತಿ ಕಾರ್ಯಕ್ಕೆ ನೂರಾರು ಡಾಲರ್ಗಳಿಂದ ಒಂದೆರಡು ಸಾವಿರ ಡಾಲರ್ಗಳವರೆಗೆ ವೆಚ್ಚವಾಗುತ್ತದೆ. ಕೊನೆಯದಾಗಿ, ಈ ಸಂಖ್ಯೆಗಳು ಪುನರಾವರ್ತಿತ ಪ್ರಯೋಗಗಳ ಬದಲು ಒಂದೊಂದು ಪ್ರಕ್ರಿಯೆಯಿಂದ ಬಂದಿವೆ. ಆದ್ದರಿಂದ ಇವುಗಳನ್ನು ಔಪಚಾರಿಕ ಅಧ್ಯಯನವಾಗಿ ಅಲ್ಲ, ಎಂಜಿನಿಯರಿಂಗ್ ಬ್ಲಾಗ್ ಲೇಖನವಾಗಿ ಹಂಚಿಕೊಳ್ಳುತ್ತಿದ್ದೇವೆ.
ಸ್ವಾಯತ್ತ ಕೋಡ್ ಸುಧಾರಣೆಯನ್ನು ಉದ್ಯಮ ಬಳಕೆಗೆ ಸಾಕಷ್ಟು ಶಿಸ್ತುಬದ್ಧವಾಗಿಸಬಹುದು ಎಂಬುದನ್ನು Meta-Harness ತೋರಿಸುತ್ತದೆ. ರಚನಾತ್ಮಕ ಪರಿಕಲ್ಪನೆಗಳು, ಮುನ್ಸೂಚಕ ಪೂರ್ವಶೋಧನೆ, ಪ್ರತ್ಯೇಕ ಮೌಲ್ಯಮಾಪನ, ದತ್ತಾಂಶ ಅವಕಾಶ ನೀಡಿದಲ್ಲೆಲ್ಲ ಪ್ರತ್ಯೇಕ ಪರೀಕ್ಷೆ ಮತ್ತು ಪ್ರಚಾರ ಪಡೆದ ಪ್ರತಿ ಬದಲಾವಣೆಯ ಹಿಂದಿರುವ ಸಂಪೂರ್ಣ ಲೆಕ್ಕಪರಿಶೋಧನಾ ಜಾಡು ಇದರ ಮುಖ್ಯ ಅಂಶಗಳು. ಇವು ಒಟ್ಟಾಗಿ ಎಂಜಿನಿಯರಿಂಗ್ ತಂಡಕ್ಕೆ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ಆರಂಭಿಕ ಪ್ರಕ್ರಿಯೆಯಿಂದ ಅಳೆಯಬಹುದಾದಷ್ಟು ಉತ್ತಮ ಪ್ರಕ್ರಿಯೆಯತ್ತ ಸಾಗಲು ಊಹಿಸಬಹುದಾದ ಮಾರ್ಗ ನೀಡುತ್ತವೆ. ಕಾರ್ಯಾಚರಣೆಯ ಮಾಲೀಕರಿಗೂ ಸರಳ ಮಾಡೆಲ್ ಅನ್ನು ಒದಗಿಸುತ್ತವೆ: ಏನನ್ನಾದರೂ ಬಿಡುಗಡೆ ಮಾಡುವ ಮೊದಲು ಮಾನವ ಪರಿಶೀಲನೆಯಿದ್ದು, ಕಟ್ಟುನಿಟ್ಟಾದ ಬಜೆಟ್-ಜಾಗೃತ ಚೌಕಟ್ಟಿನೊಳಗೆ ಸ್ವಾಯತ್ತ ಅನ್ವೇಷಣೆಯ ಪ್ರಯೋಜನ.