ಕಳೆದ ಎರಡು ವರ್ಷಗಳಿಂದ “RAG” (ಮರುಪಡೆಯುವಿಕೆ-ವರ್ಧಿತ ರಚನೆ) ಎಂಬುದು ಬಹುತೇಕ ಪಠ್ಯಕ್ಕೆ ಮಾತ್ರ ಸಮಾನಾರ್ಥಕವಾಗಿತ್ತು. ಪ್ರಮಾಣಿತ ವಿಧಾನ ಸರಳವಾಗಿದೆ: ದಾಖಲೆಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಿ, ಪಠ್ಯವನ್ನು ಹೊರತೆಗೆಯಿರಿ, ಅದನ್ನು ತುಣುಕುಗಳಾಗಿ ವಿಭಜಿಸಿ ಮತ್ತು ಸೂಚ್ಯಂಕೀಕರಿಸಿ.
ಆದರೆ ಉದ್ಯಮ ಜಗತ್ತು ಸರಳ ಪಠ್ಯ ಫೈಲ್ಗಳ ಮೇಲೆ ನಡೆಯುವುದಿಲ್ಲ. ಅದು ಸಂಕೀರ್ಣ PDFಗಳು, ದಟ್ಟ ಚಾರ್ಟ್ಗಳಿರುವ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳು, CAD ರೇಖಾಚಿತ್ರಗಳು, ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ ಇನ್ವಾಯ್ಸ್ಗಳು ಮತ್ತು ಹೆಚ್ಚುತ್ತಿರುವ ಬೃಹತ್ ವೀಡಿಯೊ ದೃಶ್ಯಾವಳಿ ಸಂಗ್ರಹಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ.
ಎಂಬೆಡ್ ಮಾಡುವ ಮೊದಲು OCR ಅಥವಾ ದೃಶ್ಯ LLMಗಳ ಮೂಲಕ ಚಿತ್ರಕ್ಕೆ ಪಠ್ಯ “ವಿವರಣೆ” ರಚಿಸಿ ಇದನ್ನು ನಿರ್ವಹಿಸುವ ಉದ್ಯಮದ ಪ್ರಮಾಣಿತ ವಿಧಾನವೇ ದೊಡ್ಡ ಅಡಚಣೆಯಾಗಿದೆ. ಅದು ನಿಧಾನವೂ ದುಬಾರಿಯೂ ಆಗಿದ್ದು, ಮೂಲ ದತ್ತಾಂಶದ ಸಮೃದ್ಧ ಪ್ರಾದೇಶಿಕ ಮತ್ತು ದೃಶ್ಯ ಸಂದರ್ಭವನ್ನು ಅನಿವಾರ್ಯವಾಗಿ ಕಳೆದುಕೊಳ್ಳುತ್ತದೆ. ನಿಮ್ಮ AI ಸಂಕೀರ್ಣ ದೃಶ್ಯವನ್ನು ಕೇವಲ “ನೀಲನಕ್ಷೆ” ಎಂದು ವಿವರಿಸಿದರೆ, ಅದರೊಳಗಿನ ನಿರ್ದಿಷ್ಟ ಕವಾಟ ಅಥವಾ ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರವನ್ನು ಹುಡುಕುವ ಸಾಮರ್ಥ್ಯವನ್ನು ನೀವು ಕಳೆದುಕೊಂಡಿದ್ದೀರಿ.
ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ ದೃಶ್ಯ ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಸಾಧ್ಯವಾಗಿಸಿ ಈ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಿದ ColPali ವಾಸ್ತುರಚನೆಯ ಆಧಾರದ ಮೇಲೆ ನಿರ್ಮಿಸಲಾದ ಅತ್ಯಾಧುನಿಕ ಬಹುಮಾಧ್ಯಮ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್ಗಳ ಸಮೂಹವನ್ನು ಇಂದು ನಾವು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ.
ಸಿದ್ಧವಾಗಿ ಲಭ್ಯವಿರುವ ದೃಶ್ಯ-ಭಾಷಾ ಮಾಡೆಲ್ (VLM) ಅನ್ನು ತೆಗೆದುಕೊಂಡು ಹುಡುಕುವಂತೆ ಸೂಚಿಸಿದರೆ ಸಾಕು ಎಂಬಷ್ಟು ಸರಳವಲ್ಲ, ನಿಜವಾಗಿಯೂ ಪರಿಣಾಮಕಾರಿ ಬಹುಮಾಧ್ಯಮ ಮರುಪಡೆಯುವಿಕೆ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುವುದು. ಬಹುಮಾಧ್ಯಮ RAG ಅನ್ನು ಹಿಂದಿನಿಂದಲೂ ತಡೆದಿರುವ ಸವಾಲುಗಳನ್ನು ಪರಿಹರಿಸಿ ColQwen3 ರಚಿಸಲು, ನಾವು ಮಾಡೆಲ್ ವಿಲೀನ ಮತ್ತು ತರಬೇತಿ ತಂತ್ರಗಳನ್ನು ಬಳಸಿದೆವು.
ಮೂಲ ಮಾಡೆಲ್ ಅನ್ನು ಮೊದಲಿನಿಂದ ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸುವ ಬದಲು, ಈಗಾಗಲೇ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್ನಿಂದ ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಗಳ ಜ್ಞಾನವನ್ನು ವರ್ಗಾಯಿಸುವ ವಿಧಾನವನ್ನು ನಾವು ರೂಪಿಸಿದೆವು. ಪ್ರಮಾಣಿತ VLMಗೆ ಚಿತ್ರಗಳನ್ನು ವಿವರಿಸುವುದು ತಿಳಿದಿರುತ್ತದೆ, ಆದರೆ ಪ್ರಶ್ನೆಗೆ ಹೋಲಿಸಿ ಅವುಗಳನ್ನು ಅರ್ಥದ ಆಧಾರದ ಮೇಲೆ ಶ್ರೇಣೀಕರಿಸುವುದು ಅಗತ್ಯವಾಗಿ ತಿಳಿದಿರುವುದಿಲ್ಲ.
ಈ ಅಂತರವನ್ನು ತುಂಬಲು ನಾವು ಹೊಂದಿಸಿದ ವಿಲೀನಿತ ತೂಕದ ತಂತ್ರಗಳನ್ನು ಬಳಸಿದೆವು. ನಮ್ಮ ಪ್ರಯೋಗಗಳಲ್ಲಿ, ಪಠ್ಯದ ಸುಪ್ತ ವಲಯದಲ್ಲಿರುವ Qwen3-Embeddingನ ಮರುಪಡೆಯುವಿಕೆ ಸಾಮರ್ಥ್ಯವನ್ನು ಬಹುಮಾಧ್ಯಮ ವಲಯಕ್ಕೆ ನೇರವಾಗಿ ವರ್ಗಾಯಿಸಬಹುದೆಂದು ಕಂಡುಕೊಂಡೆವು. ತಕ್ಷಣದ ತರಬೇತಿಯಿಲ್ಲದಿದ್ದರೂ ಅದು ಚಿತ್ರ ಮತ್ತು ವೀಡಿಯೊ ಮರುಪಡೆಯುವಿಕೆಗೆ ಸಾಮಾನ್ಯೀಕರಿಸಿತು. ಈ ಪರಿಣಾಮಕಾರಿ ಪ್ರಾರಂಭಿಕ ಸ್ಥಿತಿಯನ್ನು ದೃಢ ಆರಂಭಬಿಂದುವಾಗಿ ಬಳಸಿಕೊಂಡು, ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮತ್ತಷ್ಟು ಉತ್ತಮಗೊಳಿಸಲು ಮತ್ತು ದೃಢತೆಯನ್ನು ಖಚಿತಪಡಿಸಲು ಮಾಡೆಲ್ ಅನ್ನು ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸಿದೆವು. Qwen3-VL ಮೂಲ ಮಾಡೆಲ್ನಿಂದ ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸುವುದಕ್ಕೆ ಹೋಲಿಸಿದರೆ ಇದು ಅಂತಿಮ ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸುಧಾರಿಸುತ್ತದೆ.
ಎಂಬೆಡಿಂಗ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ವರ್ಗಾಯಿಸಿದ ನಂತರ ನಾವು ಹೊಂದಾಣಿಕೆಯತ್ತ ಗಮನಹರಿಸಿದೆವು. ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಗರಿಷ್ಠಗೊಳಿಸಲು, ಅತ್ಯುತ್ತಮ ತರಬೇತಿ ಆವರ್ತನಗಳ ಸಂಖ್ಯೆ, ಬ್ಯಾಚ್ ಗಾತ್ರ, ಕಲಿಕೆಯ ದರ, LoRA ಶ್ರೇಣಿ ಮತ್ತು ದತ್ತಾಂಶಸಮೂಹಗಳ ಮಿಶ್ರಣ ಸೇರಿದಂತೆ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್ ಹುಡುಕಾಟಗಳು ಹಾಗೂ ಅಬ್ಲೇಶನ್ ಅಧ್ಯಯನಗಳನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ನಡೆಸಿದೆವು.
ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಯ ದತ್ತಾಂಶಸಮೂಹಗಳಾಗಿ ನಾವು VDR, ColPali ತರಬೇತಿ ಸಮೂಹ, visrag_syn, ಮತ್ತು visrag_ind ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಿದೆವು. ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಗೆ ನಾವು UniMax ಮಾದರಿ ಆಯ್ಕೆಯನ್ನು ಬಳಸಿದೆವು. ನಾವು ಮಾಡೆಲ್ ವಿಲೀನವನ್ನು ಅನ್ವಯಿಸಿದ್ದರಿಂದ ಮತ್ತು ವಿಲೀನಿತ ಮೂಲ ಮಾಡೆಲ್ ಈಗಾಗಲೇ ಬಹುಮಾಧ್ಯಮ ಮರುಪಡೆಯುವಿಕೆಯ ಭಾಗಶಃ ಸಾಮರ್ಥ್ಯವನ್ನು ಪಡೆದಿದ್ದರಿಂದ, ದತ್ತಾಂಶಸಮೂಹಗಳನ್ನು ಹೆಚ್ಚಿಸುವುದು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸ್ವಲ್ಪ ಕುಗ್ಗಿಸುತ್ತದೆ ಎಂದು ಕಂಡುಕೊಂಡೆವು. ಆದ್ದರಿಂದ ಹೆಚ್ಚಿನ ದತ್ತಾಂಶಸಮೂಹಗಳಿಗೆ ವಿಸ್ತರಿಸಲಿಲ್ಲ.
ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಗಾಗಿ ನಾವು ಆಯ್ಕೆ ಮಾಡಿದ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್ಗಳು ಇವು:
LoRA ಶ್ರೇಣಿ | 32 |
LoRA ಆಲ್ಫಾ | 32 |
LoRA ಗುರಿ ಘಟಕಗಳು | ಎಂಬೆಡಿಂಗ್ ಹೊರತುಪಡಿಸಿ ಚಿತ್ರ ಮತ್ತು ಪಠ್ಯ ಎರಡರ ಎಲ್ಲ ಪದರಗಳು |
ಕಲಿಕೆಯ ದರ | 5e-5 |
ಗರಿಷ್ಠ ದೃಶ್ಯ ಟೋಕನ್ಗಳು | 1280 |
ತರಬೇತಿ ಆವರ್ತನಗಳು | 1 |
ಒಟ್ಟಾರೆ ಬ್ಯಾಚ್ ಗಾತ್ರ | 512 |
ಪೂರ್ವತಾಪ ಅನುಪಾತ | 5% |
ಹಿಂದಿನಿಂದಲೂ “ColBERT-ಶೈಲಿಯ” ಟೋಕನ್-ಮಟ್ಟದ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು (ColPaliಯಂತೆ) ಬಳಸುವ ಮಾಡೆಲ್ಗಳು ಅದ್ಭುತ ಕಾರ್ಯಕ್ಷಮತೆ ನೀಡುತ್ತಿದ್ದರೂ, ಅವುಗಳ ಸಂಗ್ರಹಣೆ ವೆಚ್ಚ ದುಬಾರಿಯಾಗಿತ್ತು. ಪ್ರತಿ ದೃಶ್ಯ ಟೋಕನ್ ಅನ್ನು ಸೂಚ್ಯಂಕೀಕರಿಸುವುದರಿಂದ ಬೃಹತ್ ವೆಕ್ಟರ್ ದತ್ತಸಂಚಯಗಳು ಸೃಷ್ಟಿಯಾಗಿ, ಉದ್ಯಮ ಮಟ್ಟದ ಬಳಕೆಗೆ ಅವು ತುಂಬಾ ದುಬಾರಿಯಾಗಿದ್ದವು.
ಅತ್ಯುತ್ತಮೀಕರಣ ತಂತ್ರ: ಗರಿಷ್ಠ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಉಳಿಸಿಕೊಂಡೇ ಸಂಗ್ರಹಣೆ ವೆಚ್ಚ ಮಿತಿಮೀರದಂತೆ ನಮ್ಮ ಎಂಬೆಡಿಂಗ್ಗಳ ಗಾತ್ರವನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ಸಮತೋಲನಗೊಳಿಸಿ, ಸಂಗ್ರಹಣೆಯ ಸವಾಲನ್ನು ಪರಿಹರಿಸಿದೆವು. ಈ ದಕ್ಷ ಗಾತ್ರದಲ್ಲೇ ಅತ್ಯಾಧುನಿಕ ನಿಖರತೆಯನ್ನು ಉಳಿಸಿಕೊಳ್ಳಲು, ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಸಂಗ್ರಹಣೆ ವೆಚ್ಚದ ಅತ್ಯುತ್ತಮ ಸಮತೋಲನಕ್ಕಾಗಿ ಆಯಾಮದ ಗಾತ್ರವನ್ನು 320 ಎಂದು ಎಚ್ಚರಿಕೆಯಿಂದ ಆಯ್ಕೆ ಮಾಡಿದೆವು.
ಆಧಾರಮಟ್ಟ: 10 ಲಕ್ಷ ಚಿತ್ರಗಳ ಎಂಬೆಡಿಂಗ್ಗಳನ್ನು ಸಂಗ್ರಹಿಸಲು ಪ್ರಮಾಣಿತ ವಿಧಾನಕ್ಕೆ (NVIDIA Nemo-3Bಯಂತೆ) ಸುಮಾರು 10.3 TB ಅಗತ್ಯವಿದೆ (1,802 ಟೋಕನ್ಗಳು @ 3,072 ಆಯಾಮಗಳು).
ColQwen3: ಅದೇ 10 ಲಕ್ಷ ಚಿತ್ರಗಳನ್ನು ಕೇವಲ 0.82 TBಯಲ್ಲಿ ಸಂಗ್ರಹಿಸುತ್ತದೆ (ಗರಿಷ್ಠ 1,280 ಟೋಕನ್ಗಳು @ 320 ಆಯಾಮಗಳು).
ಕ್ಲೌಡ್ ಮೂಲಸೌಕರ್ಯದ ವೆಚ್ಚವನ್ನು ಮಿತಿಮೀರಿ ಹೆಚ್ಚಿಸದೆ ColQwen3 ಅತ್ಯಾಧುನಿಕ ಮರುಪಡೆಯುವಿಕೆ ನಿಖರತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ.
ನಾವು ನಮ್ಮ ವಿಧಾನವನ್ನು ViDoRe ಮಾನದಂಡಗಳ ಸಮೂಹದಲ್ಲಿ ಪರಿಶೀಲಿಸಿದೆವು. ಹಳೆಯ V1 ಕಾರ್ಯಗಳಲ್ಲಿ ಉನ್ನತ ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಉಳಿಸಿಕೊಂಡೇ, ಇತ್ತೀಚಿನ V3 ಮತ್ತು V2 ಮಾನದಂಡಗಳಲ್ಲಿ (ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಬಹುಭಾಷಾ ಎರಡರಲ್ಲೂ) ColQwen3 ಹೊಸ ಮಾನದಂಡಗಳನ್ನು ಸ್ಥಾಪಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಫಲಿತಾಂಶಗಳು ದೃಢಪಡಿಸುತ್ತವೆ.
ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಬಹುಭಾಷಾ ಮರುಪಡೆಯುವಿಕೆಯಲ್ಲಿ ColQwen3-8B ಮುಂಚೂಣಿಯಲ್ಲಿದೆ.
ಇಂಗ್ಲಿಷ್ nDCG@5
ಮಾಡೆಲ್ | ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನ | ಇಂಧನ | ಹಣಕಾಸು | ಮಾನವ ಸಂಪನ್ಮೂಲ | ಕೈಗಾರಿಕೆ | ಔಷಧೋದ್ಯಮ | ಭೌತಶಾಸ್ತ್ರ | ಸರಾಸರಿ |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
ಬಹುಭಾಷಾ nDCG@5
ಮಾಡೆಲ್ | ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನ | ಇಂಧನ | ಹಣಕಾಸು | ಮಾನವ ಸಂಪನ್ಮೂಲ | ಕೈಗಾರಿಕೆ | ಔಷಧೋದ್ಯಮ | ಭೌತಶಾಸ್ತ್ರ | ಸರಾಸರಿ |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, ಅರ್ಥಶಾಸ್ತ್ರ ಮತ್ತು DocVQA ವಿಭಾಗಗಳಲ್ಲಿ ಸ್ಥಿರವಾದ ಉನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆ.
ಮಾನದಂಡ | ಮಾಡೆಲ್ | ಸ್ಕೋರ್ (ಸರಾಸರಿ) | ಗಮನಾರ್ಹ ಸಾಧನೆ |
ViDoRe V2 (ಇಂಗ್ಲಿಷ್) | ColQwen3-8B | 0.6772 | ESG ಮತ್ತು BioMedನಲ್ಲಿ #1 |
ViDoRe V2 (ಬಹುಭಾಷಾ) | ColQwen3-8B | 0.6085 | ಅರ್ಥಶಾಸ್ತ್ರದಲ್ಲಿ #1 |
ViDoRe V1 (ಇಂಗ್ಲಿಷ್) | Nemo ColEmbed 3B | 0.9100 | ಸ್ವಲ್ಪ ಹೆಚ್ಚಿನ ಸರಾಸರಿ |
ViDoRe V1 (ಇಂಗ್ಲಿಷ್) | ColQwen3-8B | 0.9076 | ArxivQA ಮತ್ತು Syn-Govನಲ್ಲಿ #1 |
ವೀಡಿಯೊ ಮರುಪಡೆಯುವಿಕೆಗೂ ColQwen3 ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಸಾಮಾನ್ಯೀಕರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸಲು, ಪಠ್ಯದಿಂದ ವೀಡಿಯೊಗೆ (ಸಾಮಾನ್ಯ ಮರುಪಡೆಯುವಿಕೆ) ಸಂಬಂಧಿಸಿದ ಕಾರ್ಯಗಳಿಗಾಗಿ CareBench ಮಾನದಂಡದಲ್ಲಿ ಮಾಡೆಲ್ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು.
ಈ ಮೌಲ್ಯಮಾಪನಕ್ಕಾಗಿ ನಾವು ಕಚ್ಚಾ ವೀಡಿಯೊ ಎನ್ಕೋಡಿಂಗ್ ವಿಧಾನವನ್ನು ಬಳಸಿದೆವು: ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಪಠ್ಯ ಟಿಪ್ಪಣಿಗಳು ಅಥವಾ ಮೆಟಾಡೇಟಾ ಇನ್ಪುಟ್ಗಳಿಲ್ಲದೆ ನಮ್ಮ ಮಾಡೆಲ್ಗಳು ವೀಡಿಯೊ ಫೈಲ್ಗಳನ್ನು ನೇರವಾಗಿ ಎನ್ಕೋಡ್ ಮಾಡಿದವು. ಸಂಪೂರ್ಣವಾಗಿ ದೃಶ್ಯಾರ್ಥದ ಆಧಾರದ ಮೇಲೆ ಮರುಪಡೆಯುವಿಕೆ ನಡೆಸುವ ಮಾಡೆಲ್ನ ಸಾಮರ್ಥ್ಯವನ್ನು ಇದು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.
ಮಾಡೆಲ್ | ಮರುಪಡೆಯುವಿಕೆ@1 | ಮರುಪಡೆಯುವಿಕೆ@5 | ಮರುಪಡೆಯುವಿಕೆ@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ವೀಡಿಯೊವನ್ನೂ ದಾಖಲೆಗಳಂತೆಯೇ ಪರಿಗಣಿಸುವ ColQwen3 ಸಾಮರ್ಥ್ಯವು ಅದು ಸಾಧ್ಯವಾಗಿಸಿರುವ ಅತ್ಯಂತ ಮಹತ್ವದ ಬದಲಾವಣೆಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ. ಅನೇಕ ಉದ್ಯಮಗಳಲ್ಲಿ ವೀಡಿಯೊ “ಅಜ್ಞಾತ ದತ್ತಾಂಶ”ವಾಗಿದೆ. ಪ್ರತಿಯೊಂದು ಫೈಲ್ಗೂ ಯಾರಾದರೂ ಕೈಯಾರೆ ಟ್ಯಾಗ್ ಮಾಡದಿದ್ದರೆ, ಅದು ಹುಡುಕಲಾಗದ ಸ್ಥಿತಿಯಲ್ಲಿ ಕೋಲ್ಡ್ ಸ್ಟೋರೇಜ್ನಲ್ಲೇ ಉಳಿಯುತ್ತದೆ.
ವಿಭಜಿಸಿದ ಕ್ಲಿಪ್ಗಳಲ್ಲಿ ಫ್ರೇಮ್ವಾರು ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಸಾಧ್ಯವಾಗಿಸುವ ಮೂಲಕ ColQwen3 ಇದನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ.
ಉದ್ಯಮಗಳು ಪ್ರತಿದಿನ ಸಾವಿರಾರು ಗಂಟೆಗಳ ಆಂತರಿಕ ವೀಡಿಯೊ ಸಭೆಗಳನ್ನು ದಾಖಲಿಸುತ್ತವೆ; ಸಾಮಾನ್ಯವಾಗಿ ಈ ರೆಕಾರ್ಡಿಂಗ್ಗಳು ಯಾರಿಗೂ ಸಿಗದೆ ಕಣ್ಮರೆಯಾಗುತ್ತವೆ.
ಕಾರ್ಯವಿಧಾನ: ದೀರ್ಘ ಸಭೆಯ ರೆಕಾರ್ಡಿಂಗ್ಗಳನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಚಿಕ್ಕದಾದ, ತಾರ್ಕಿಕ ಕ್ಲಿಪ್ಗಳಾಗಿ ವಿಭಜಿಸಿ, ಅವುಗಳನ್ನು ColQwen3 ಮೂಲಕ ಸೂಚ್ಯಂಕೀಕರಿಸಿದರೆ ಹುಡುಕಬಹುದಾದ “ಸಂಸ್ಥೆಯ ಸ್ಮೃತಿ” ರೂಪುಗೊಳ್ಳುತ್ತದೆ.
ಪ್ರಶ್ನೆ: ಯೋಜನಾ ವ್ಯವಸ್ಥಾಪಕರು ಹೀಗೆ ಕೇಳಬಹುದು: “APIಯ ವಿಳಂಬ ಸಮಸ್ಯೆಯನ್ನು ಎಂಜಿನಿಯರಿಂಗ್ ಮುಖ್ಯಸ್ಥರು ವಿವರಿಸಿದ ಕ್ಲಿಪ್ ತೋರಿಸಿ.”
ಫಲಿತಾಂಶ: 60 ನಿಮಿಷಗಳ ವೀಡಿಯೊ ಫೈಲ್ ಅನ್ನು ಹಿಂದಿರುಗಿಸುವ ಬದಲು, ಆ ನಿರ್ದಿಷ್ಟ ರೇಖಾಚಿತ್ರವನ್ನು ಪರದೆಯಲ್ಲಿ ತೋರಿಸಿ ಚರ್ಚಿಸಿದ ನಿಖರವಾದ 45 ಸೆಕೆಂಡುಗಳ ಭಾಗವನ್ನು ವ್ಯವಸ್ಥೆ ಮರುಪಡೆಯುತ್ತದೆ. ಆ ಕ್ಷಣದಲ್ಲಿ ಮಾತನಾಡಿದವರು “ವಿಳಂಬ” ಎಂಬ ಪದವನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳದಿದ್ದರೂ ಇದು ಸಾಧ್ಯ.
ಸ್ಥಳೀಯ ಬಹುಮಾಧ್ಯಮ ಎಂಬೆಡಿಂಗ್ಗೆ ಬದಲಾಗುವುದರಿಂದ ವಿವಿಧ ಉದ್ಯಮಗಳಲ್ಲಿ ಸಂಪೂರ್ಣ ಹೊಸ ಕಾರ್ಯವಿಧಾನಗಳು ಸಾಧ್ಯವಾಗುತ್ತವೆ. ಕೆಲವು ಅತ್ಯಂತ ಸಂಕೀರ್ಣ ಉದ್ಯಮ ದತ್ತಾಂಶ ಪರಿಸರಗಳಿಗೆ ಹೋಲಿಸಿ ನಾವು ಈ ಮಾಡೆಲ್ ಅನ್ನು ವ್ಯಾಪಕವಾಗಿ ಮಾನದಂಡ ಪರೀಕ್ಷೆಗೆ ಒಳಪಡಿಸಿದ್ದೇವೆ.
ಮಹಾಯೋಜನೆಗಳು, ವಲಯ ನಕ್ಷೆಗಳು ಮತ್ತು ಸಂಕೀರ್ಣ ವಾಸ್ತುಶಿಲ್ಪೀಯ ಎಲಿವೇಶನ್ಗಳ ಬೃಹತ್ ಸಂಗ್ರಹಗಳನ್ನು ನಿರ್ವಹಿಸುವ ನಗರ ಸಮಾಲೋಚನಾ ಸಂಸ್ಥೆಗಳು ಎದುರಿಸುವ ದತ್ತಾಂಶ ಸವಾಲುಗಳಲ್ಲಿ ನಾವು ColQwen3 ಅನ್ನು ಪರೀಕ್ಷಿಸಿದೆವು.
ಸವಾಲು: ಇಂತಹ ಪರಿಸರಗಳಲ್ಲಿ ಸಾಂಪ್ರದಾಯಿಕ RAG ಪೈಪ್ಲೈನ್ಗಳು ಸಮರ್ಥವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದಿಲ್ಲ. OCR ಸಾಧನಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಸಂಕೀರ್ಣ ನಿವೇಶನ ಯೋಜನೆಗಳನ್ನು ಕೇವಲ “ರೇಖಾಚಿತ್ರ” ಎಂದು ವಿವರಿಸುತ್ತವೆ; ಸಂಚಾರ ಹರಿವು, ಹಸಿರು ವಲಯಗಳು ಅಥವಾ ಕಟ್ಟಡದ ಹಿನ್ನಡೆ ಅಂತರಗಳಂತಹ ನಿರ್ಣಾಯಕ ವಿವರಗಳು ಇದರಿಂದ ತಪ್ಪಿಹೋಗುತ್ತವೆ.
ಕಾರ್ಯಕ್ಷಮತೆ: ದುಬಾರಿ OCR/ವಿವರಣೆ ಪೂರ್ವಸಂಸ್ಕರಣೆಯ ಅಗತ್ಯವನ್ನು ColQwen3 ಪರಿಣಾಮಕಾರಿಯಾಗಿ ನಿವಾರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ನಮ್ಮ ಆಂತರಿಕ ಮಾನದಂಡಗಳು ತೋರಿಸುತ್ತವೆ. ದಟ್ಟವಾದ ವಾಸ್ತುಶಿಲ್ಪೀಯ ರೇಖಾಚಿತ್ರಗಳ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಪಾದಚಾರಿ ಪ್ರವೇಶ ಬಿಂದುಗಳು ಅಥವಾ ವಿಭಿನ್ನ ವಲಯ ಗಡಿಗಳಂತಹ ನಿರ್ದಿಷ್ಟ ದೃಶ್ಯ ಗುರುತುಗಳ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ದಾಖಲೆಗಳನ್ನು ಯಶಸ್ವಿಯಾಗಿ ಮರುಪಡೆಯಿತು. ಇದು ಪಠ್ಯ-ಮಾತ್ರದ ಆಧಾರಮಟ್ಟಗಳನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಮೀರಿಸುವುದರ ಜೊತೆಗೆ ಜ್ಞಾನ ಅಳವಡಿಕೆ ವೆಚ್ಚವನ್ನು ಭಾರಿ ಪ್ರಮಾಣದಲ್ಲಿ ಕಡಿಮೆ ಮಾಡುವ ಭರವಸೆ ನೀಡುತ್ತದೆ.
ಹೂಡಿಕೆ ಬ್ಯಾಂಕರ್ಗಳು ಮತ್ತು ವಿಶ್ಲೇಷಕರು ವಾರ್ಷಿಕ ವರದಿಗಳು ಹಾಗೂ ಹೂಡಿಕೆದಾರರ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳನ್ನು ಪರಿಶೀಲಿಸಲು ಸಾವಿರಾರು ಗಂಟೆಗಳನ್ನು ವ್ಯಯಿಸುತ್ತಾರೆ.
ಕಾರ್ಯವಿಧಾನ: ವಿಶ್ಲೇಷಕರು ಹೀಗೆ ಕೇಳಬಹುದು: “2024ರ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳಿಂದ APAC ಆದಾಯ ಮತ್ತು EMEA ಆದಾಯದ ವಿವರವಾದ ಹೋಲಿಕೆಯನ್ನು ಹುಡುಕಿ.”
ಬದಲಾವಣೆ: ಕೀವರ್ಡ್ ಹೊಂದಾಣಿಕೆಗಳನ್ನು ಅವಲಂಬಿಸುವ ಬದಲು, ನಿರ್ದಿಷ್ಟ ದತ್ತಾಂಶ ದೃಶ್ಯೀಕರಣವು ದೃಶ್ಯವಾಗಿ ಇರುವುದರ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ನಿಖರವಾದ ಸ್ಲೈಡ್ ಅನ್ನು ಮರುಪಡೆಯುತ್ತದೆ. ಇದರಿಂದ RAG ವ್ಯವಸ್ಥೆಯು ಪ್ರಶ್ನೆಗಳಿಗೆ ಹೆಚ್ಚಿನ ನಿಖರತೆಯಿಂದ ಉತ್ತರಿಸಬಹುದು.
ಉತ್ಪಾದನಾ ಸಂಸ್ಥೆಗಳು ತಾಂತ್ರಿಕ ಕೈಪಿಡಿಗಳು ಮತ್ತು ಪೈಪಿಂಗ್ ರೇಖಾಚಿತ್ರಗಳ (P&IDಗಳು) ಬೃಹತ್ ಸಂಗ್ರಹಗಳನ್ನು ಹೊಂದಿವೆ.
ಕಾರ್ಯವಿಧಾನ: ಟರ್ಬೈನ್ ದುರಸ್ತಿ ಮಾಡುವ ಕ್ಷೇತ್ರ ಎಂಜಿನಿಯರ್ ಒಂದು ಭಾಗದ ಚಿತ್ರ ತೆಗೆದುಕೊಳ್ಳಬಹುದು ಅಥವಾ “ಹೈಡ್ರಾಲಿಕ್ ಪಂಪ್ ಜೋಡಣೆಯ ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರವನ್ನು ತೋರಿಸಿ.” ಎಂದು ಕೇಳಬಹುದು.
ಬದಲಾವಣೆ: ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರದ ದೃಶ್ಯ ನಿರೂಪಣೆಯನ್ನು ColQwen3 ಗುರುತಿಸಿ ಸರಿಯಾದ ಪುಟವನ್ನು ಮರುಪಡೆಯುತ್ತದೆ. ಇದರಿಂದ ಕಾರ್ಯಸ್ಥಗಿತದ ಅವಧಿಯನ್ನು ಹಲವು ಗಂಟೆಗಳಷ್ಟು ಕಡಿಮೆ ಮಾಡಬಹುದು.
ಕಾನೂನು ಶೋಧನೆಯಲ್ಲಿ ಲಕ್ಷಾಂತರ ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ ಪುಟಗಳನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗುತ್ತದೆ; ಅವುಗಳಲ್ಲಿ ಹುಡುಕಬೇಕಾದ ಮುಖ್ಯ ಅಂಶವು ಅನೇಕ ಬಾರಿ ದೃಶ್ಯ ಗುರುತಾಗಿರುತ್ತದೆ.
ಕಾರ್ಯವಿಧಾನ: ಅನುಸರಣೆ ಅಧಿಕಾರಿ “ಮುಖ್ಯ ಹಣಕಾಸು ಅಧಿಕಾರಿ ಸಹಿ ಮಾಡಿದ ದಾಖಲೆಗಳು” ಅಥವಾ “ಅಧಿಕೃತ ‘ಗೌಪ್ಯ’ ಮುದ್ರೆಯಿರುವ ಒಪ್ಪಂದಗಳು” ಎಂದು ಹುಡುಕಬಹುದು.
ಬದಲಾವಣೆ: ಸಹಿಗಳು ಅಥವಾ ಮುದ್ರೆಗಳು ದೃಶ್ಯವಾಗಿ ಇರುವುದರ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ಕರಡು ಮತ್ತು ಅಂತಿಮಗೊಳಿಸಿದ ದಾಖಲೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸ ಗುರುತಿಸುತ್ತದೆ. ಕೇವಲ OCR ಬಳಸಿದಾಗ ಇದು ಹೆಚ್ಚಾಗಿ ತಪ್ಪಿಹೋಗುತ್ತದೆ.
ColQwen3 ಮುಕ್ತ ತೂಕಗಳನ್ನು ಹೊಂದಿದೆ (Apache 2.0) ಮತ್ತು ಈಗ Hugging Faceನಲ್ಲಿ ಲಭ್ಯವಿದೆ. ಆಧುನಿಕ RAG ಪೈಪ್ಲೈನ್ಗಳಿಗೆ ನೇರವಾಗಿ ಅಳವಡಿಸಬಹುದಾದ ಉನ್ನತೀಕರಣವಾಗಿ ಇದನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿದ್ದೇವೆ. ಪಠ್ಯ, ಚಿತ್ರಗಳು ಮತ್ತು ವೀಡಿಯೊವನ್ನು ತಕ್ಷಣ ಸಂಸ್ಕರಿಸಲು ಬೇಕಾದ ನಿರ್ಣಯ ಸಂಕೇತವೂ ಇದರಲ್ಲಿದೆ.
ಸರಳ ಪಠ್ಯ ಹುಡುಕಾಟವನ್ನು ಮೀರಿ, ತಮ್ಮ ದೃಶ್ಯ ಸಂಪನ್ಮೂಲಗಳಲ್ಲಿ ಅಡಗಿರುವ ತಿಳಿವಳಿಕೆಯನ್ನು ಬಳಕೆಗೆ ತೆರೆಯಲು ಸಿದ್ಧವಾಗಿರುವ ಉದ್ಯಮಗಳಿಗೆ ಇದು ಹೊಸ ಮಾನದಂಡವಾಗಿದೆ.
ಮುಂದಿನ ಹೆಜ್ಜೆ: ಮಾಡೆಲ್ ಕಾರ್ಡ್ ನೋಡಿ ಮತ್ತು Hugging Faceನಲ್ಲಿ ನೇರ ಪ್ರದರ್ಶನವನ್ನು ಪ್ರಯತ್ನಿಸಿ: /-colqwen3-embed-8b ಮತ್ತು /-colqwen3-embed-4b