ಪಠ್ಯವನ್ನು ಮೀರಿ: ನಿಜವಾದ ಬಹುಮಾಧ್ಯಮ, ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ RAG ಬಳಕೆಗೆ ತೆರೆಯಿರಿ

ಸಂಕೀರ್ಣ ದಾಖಲೆಗಳು, ಚಿತ್ರಗಳು ಮತ್ತು ವೀಡಿಯೊಗಳಿಂದ ಉಪಯುಕ್ತ ಮಾಹಿತಿಯನ್ನು ನೇರವಾಗಿ ಮರುಪಡೆಯಲು ಬಹುಮಾಧ್ಯಮ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ಗಳು ತಂಡಗಳಿಗೆ ನೆರವಾಗುತ್ತವೆ.

ಕಳೆದ ಎರಡು ವರ್ಷಗಳಿಂದ “RAG” (ಮರುಪಡೆಯುವಿಕೆ-ವರ್ಧಿತ ರಚನೆ) ಎಂಬುದು ಬಹುತೇಕ ಪಠ್ಯಕ್ಕೆ ಮಾತ್ರ ಸಮಾನಾರ್ಥಕವಾಗಿತ್ತು. ಪ್ರಮಾಣಿತ ವಿಧಾನ ಸರಳವಾಗಿದೆ: ದಾಖಲೆಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಿ, ಪಠ್ಯವನ್ನು ಹೊರತೆಗೆಯಿರಿ, ಅದನ್ನು ತುಣುಕುಗಳಾಗಿ ವಿಭಜಿಸಿ ಮತ್ತು ಸೂಚ್ಯಂಕೀಕರಿಸಿ.

ಆದರೆ ಉದ್ಯಮ ಜಗತ್ತು ಸರಳ ಪಠ್ಯ ಫೈಲ್‌ಗಳ ಮೇಲೆ ನಡೆಯುವುದಿಲ್ಲ. ಅದು ಸಂಕೀರ್ಣ PDFಗಳು, ದಟ್ಟ ಚಾರ್ಟ್‌ಗಳಿರುವ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳು, CAD ರೇಖಾಚಿತ್ರಗಳು, ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ ಇನ್‌ವಾಯ್ಸ್‌ಗಳು ಮತ್ತು ಹೆಚ್ಚುತ್ತಿರುವ ಬೃಹತ್ ವೀಡಿಯೊ ದೃಶ್ಯಾವಳಿ ಸಂಗ್ರಹಗಳ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿದೆ.

ಎಂಬೆಡ್ ಮಾಡುವ ಮೊದಲು OCR ಅಥವಾ ದೃಶ್ಯ LLMಗಳ ಮೂಲಕ ಚಿತ್ರಕ್ಕೆ ಪಠ್ಯ “ವಿವರಣೆ” ರಚಿಸಿ ಇದನ್ನು ನಿರ್ವಹಿಸುವ ಉದ್ಯಮದ ಪ್ರಮಾಣಿತ ವಿಧಾನವೇ ದೊಡ್ಡ ಅಡಚಣೆಯಾಗಿದೆ. ಅದು ನಿಧಾನವೂ ದುಬಾರಿಯೂ ಆಗಿದ್ದು, ಮೂಲ ದತ್ತಾಂಶದ ಸಮೃದ್ಧ ಪ್ರಾದೇಶಿಕ ಮತ್ತು ದೃಶ್ಯ ಸಂದರ್ಭವನ್ನು ಅನಿವಾರ್ಯವಾಗಿ ಕಳೆದುಕೊಳ್ಳುತ್ತದೆ. ನಿಮ್ಮ AI ಸಂಕೀರ್ಣ ದೃಶ್ಯವನ್ನು ಕೇವಲ “ನೀಲನಕ್ಷೆ” ಎಂದು ವಿವರಿಸಿದರೆ, ಅದರೊಳಗಿನ ನಿರ್ದಿಷ್ಟ ಕವಾಟ ಅಥವಾ ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರವನ್ನು ಹುಡುಕುವ ಸಾಮರ್ಥ್ಯವನ್ನು ನೀವು ಕಳೆದುಕೊಂಡಿದ್ದೀರಿ.

ಆರಂಭದಿಂದ ಅಂತ್ಯದವರೆಗಿನ ದೃಶ್ಯ ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಸಾಧ್ಯವಾಗಿಸಿ ಈ ಸಮಸ್ಯೆಯನ್ನು ಪರಿಹರಿಸಲು ವಿನ್ಯಾಸಗೊಳಿಸಿದ ColPali ವಾಸ್ತುರಚನೆಯ ಆಧಾರದ ಮೇಲೆ ನಿರ್ಮಿಸಲಾದ ಅತ್ಯಾಧುನಿಕ ಬಹುಮಾಧ್ಯಮ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ಗಳ ಸಮೂಹವನ್ನು ಇಂದು ನಾವು ಬಿಡುಗಡೆ ಮಾಡುತ್ತಿದ್ದೇವೆ.

ಈ ಅದ್ಭುತದ ಹಿಂದಿನ ಎಂಜಿನಿಯರಿಂಗ್: ಸುಧಾರಿತ ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆ ತಂತ್ರಗಳು

ಸಿದ್ಧವಾಗಿ ಲಭ್ಯವಿರುವ ದೃಶ್ಯ-ಭಾಷಾ ಮಾಡೆಲ್ (VLM) ಅನ್ನು ತೆಗೆದುಕೊಂಡು ಹುಡುಕುವಂತೆ ಸೂಚಿಸಿದರೆ ಸಾಕು ಎಂಬಷ್ಟು ಸರಳವಲ್ಲ, ನಿಜವಾಗಿಯೂ ಪರಿಣಾಮಕಾರಿ ಬಹುಮಾಧ್ಯಮ ಮರುಪಡೆಯುವಿಕೆ ವ್ಯವಸ್ಥೆಯನ್ನು ನಿರ್ಮಿಸುವುದು. ಬಹುಮಾಧ್ಯಮ RAG ಅನ್ನು ಹಿಂದಿನಿಂದಲೂ ತಡೆದಿರುವ ಸವಾಲುಗಳನ್ನು ಪರಿಹರಿಸಿ ColQwen3 ರಚಿಸಲು, ನಾವು ಮಾಡೆಲ್ ವಿಲೀನ ಮತ್ತು ತರಬೇತಿ ತಂತ್ರಗಳನ್ನು ಬಳಸಿದೆವು.

1. ಹೊಂದಿಸಿದ ವಿಲೀನಿತ ತೂಕದ ಮೂಲಕ ಎಂಬೆಡಿಂಗ್ ಸಾಮರ್ಥ್ಯ ವರ್ಗಾವಣೆ

ಮೂಲ ಮಾಡೆಲ್ ಅನ್ನು ಮೊದಲಿನಿಂದ ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸುವ ಬದಲು, ಈಗಾಗಲೇ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಪಠ್ಯ ಎಂಬೆಡಿಂಗ್ ಮಾಡೆಲ್‌ನಿಂದ ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಗಳ ಜ್ಞಾನವನ್ನು ವರ್ಗಾಯಿಸುವ ವಿಧಾನವನ್ನು ನಾವು ರೂಪಿಸಿದೆವು. ಪ್ರಮಾಣಿತ VLMಗೆ ಚಿತ್ರಗಳನ್ನು ವಿವರಿಸುವುದು ತಿಳಿದಿರುತ್ತದೆ, ಆದರೆ ಪ್ರಶ್ನೆಗೆ ಹೋಲಿಸಿ ಅವುಗಳನ್ನು ಅರ್ಥದ ಆಧಾರದ ಮೇಲೆ ಶ್ರೇಣೀಕರಿಸುವುದು ಅಗತ್ಯವಾಗಿ ತಿಳಿದಿರುವುದಿಲ್ಲ.

ಈ ಅಂತರವನ್ನು ತುಂಬಲು ನಾವು ಹೊಂದಿಸಿದ ವಿಲೀನಿತ ತೂಕದ ತಂತ್ರಗಳನ್ನು ಬಳಸಿದೆವು. ನಮ್ಮ ಪ್ರಯೋಗಗಳಲ್ಲಿ, ಪಠ್ಯದ ಸುಪ್ತ ವಲಯದಲ್ಲಿರುವ Qwen3-Embeddingನ ಮರುಪಡೆಯುವಿಕೆ ಸಾಮರ್ಥ್ಯವನ್ನು ಬಹುಮಾಧ್ಯಮ ವಲಯಕ್ಕೆ ನೇರವಾಗಿ ವರ್ಗಾಯಿಸಬಹುದೆಂದು ಕಂಡುಕೊಂಡೆವು. ತಕ್ಷಣದ ತರಬೇತಿಯಿಲ್ಲದಿದ್ದರೂ ಅದು ಚಿತ್ರ ಮತ್ತು ವೀಡಿಯೊ ಮರುಪಡೆಯುವಿಕೆಗೆ ಸಾಮಾನ್ಯೀಕರಿಸಿತು. ಈ ಪರಿಣಾಮಕಾರಿ ಪ್ರಾರಂಭಿಕ ಸ್ಥಿತಿಯನ್ನು ದೃಢ ಆರಂಭಬಿಂದುವಾಗಿ ಬಳಸಿಕೊಂಡು, ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಮತ್ತಷ್ಟು ಉತ್ತಮಗೊಳಿಸಲು ಮತ್ತು ದೃಢತೆಯನ್ನು ಖಚಿತಪಡಿಸಲು ಮಾಡೆಲ್ ಅನ್ನು ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸಿದೆವು. Qwen3-VL ಮೂಲ ಮಾಡೆಲ್‌ನಿಂದ ಸೂಕ್ಷ್ಮವಾಗಿ ಹೊಂದಿಸುವುದಕ್ಕೆ ಹೋಲಿಸಿದರೆ ಇದು ಅಂತಿಮ ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸುಧಾರಿಸುತ್ತದೆ.

2. ಎಚ್ಚರಿಕೆಯ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್ ಹೊಂದಾಣಿಕೆ

ಎಂಬೆಡಿಂಗ್ ಸಾಮರ್ಥ್ಯಗಳನ್ನು ವರ್ಗಾಯಿಸಿದ ನಂತರ ನಾವು ಹೊಂದಾಣಿಕೆಯತ್ತ ಗಮನಹರಿಸಿದೆವು. ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಗರಿಷ್ಠಗೊಳಿಸಲು, ಅತ್ಯುತ್ತಮ ತರಬೇತಿ ಆವರ್ತನಗಳ ಸಂಖ್ಯೆ, ಬ್ಯಾಚ್ ಗಾತ್ರ, ಕಲಿಕೆಯ ದರ, LoRA ಶ್ರೇಣಿ ಮತ್ತು ದತ್ತಾಂಶಸಮೂಹಗಳ ಮಿಶ್ರಣ ಸೇರಿದಂತೆ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್ ಹುಡುಕಾಟಗಳು ಹಾಗೂ ಅಬ್ಲೇಶನ್ ಅಧ್ಯಯನಗಳನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ನಡೆಸಿದೆವು.

ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಯ ದತ್ತಾಂಶಸಮೂಹಗಳಾಗಿ ನಾವು VDR, ColPali ತರಬೇತಿ ಸಮೂಹ, visrag_syn, ಮತ್ತು visrag_ind ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಿದೆವು. ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಗೆ ನಾವು UniMax ಮಾದರಿ ಆಯ್ಕೆಯನ್ನು ಬಳಸಿದೆವು. ನಾವು ಮಾಡೆಲ್ ವಿಲೀನವನ್ನು ಅನ್ವಯಿಸಿದ್ದರಿಂದ ಮತ್ತು ವಿಲೀನಿತ ಮೂಲ ಮಾಡೆಲ್ ಈಗಾಗಲೇ ಬಹುಮಾಧ್ಯಮ ಮರುಪಡೆಯುವಿಕೆಯ ಭಾಗಶಃ ಸಾಮರ್ಥ್ಯವನ್ನು ಪಡೆದಿದ್ದರಿಂದ, ದತ್ತಾಂಶಸಮೂಹಗಳನ್ನು ಹೆಚ್ಚಿಸುವುದು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸ್ವಲ್ಪ ಕುಗ್ಗಿಸುತ್ತದೆ ಎಂದು ಕಂಡುಕೊಂಡೆವು. ಆದ್ದರಿಂದ ಹೆಚ್ಚಿನ ದತ್ತಾಂಶಸಮೂಹಗಳಿಗೆ ವಿಸ್ತರಿಸಲಿಲ್ಲ.

ಸೂಕ್ಷ್ಮ-ಹೊಂದಾಣಿಕೆಗಾಗಿ ನಾವು ಆಯ್ಕೆ ಮಾಡಿದ ಹೈಪರ್-ಪ್ಯಾರಾಮೀಟರ್‌ಗಳು ಇವು:

LoRA ಶ್ರೇಣಿ

32

LoRA ಆಲ್ಫಾ

32

LoRA ಗುರಿ ಘಟಕಗಳು

ಎಂಬೆಡಿಂಗ್ ಹೊರತುಪಡಿಸಿ ಚಿತ್ರ ಮತ್ತು ಪಠ್ಯ ಎರಡರ ಎಲ್ಲ ಪದರಗಳು

ಕಲಿಕೆಯ ದರ

5e-5

ಗರಿಷ್ಠ ದೃಶ್ಯ ಟೋಕನ್‌ಗಳು

1280

ತರಬೇತಿ ಆವರ್ತನಗಳು

1

ಒಟ್ಟಾರೆ ಬ್ಯಾಚ್ ಗಾತ್ರ

512

ಪೂರ್ವತಾಪ ಅನುಪಾತ

5%

3. “ColBERT” ಇಕ್ಕಟ್ಟು: ಉನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಸಂಗ್ರಹಣೆ ವೆಚ್ಚ

ಹಿಂದಿನಿಂದಲೂ “ColBERT-ಶೈಲಿಯ” ಟೋಕನ್-ಮಟ್ಟದ ಎಂಬೆಡಿಂಗ್‌ಗಳನ್ನು (ColPaliಯಂತೆ) ಬಳಸುವ ಮಾಡೆಲ್‌ಗಳು ಅದ್ಭುತ ಕಾರ್ಯಕ್ಷಮತೆ ನೀಡುತ್ತಿದ್ದರೂ, ಅವುಗಳ ಸಂಗ್ರಹಣೆ ವೆಚ್ಚ ದುಬಾರಿಯಾಗಿತ್ತು. ಪ್ರತಿ ದೃಶ್ಯ ಟೋಕನ್ ಅನ್ನು ಸೂಚ್ಯಂಕೀಕರಿಸುವುದರಿಂದ ಬೃಹತ್ ವೆಕ್ಟರ್ ದತ್ತಸಂಚಯಗಳು ಸೃಷ್ಟಿಯಾಗಿ, ಉದ್ಯಮ ಮಟ್ಟದ ಬಳಕೆಗೆ ಅವು ತುಂಬಾ ದುಬಾರಿಯಾಗಿದ್ದವು.

  • ಅತ್ಯುತ್ತಮೀಕರಣ ತಂತ್ರ: ಗರಿಷ್ಠ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಉಳಿಸಿಕೊಂಡೇ ಸಂಗ್ರಹಣೆ ವೆಚ್ಚ ಮಿತಿಮೀರದಂತೆ ನಮ್ಮ ಎಂಬೆಡಿಂಗ್‌ಗಳ ಗಾತ್ರವನ್ನು ಎಚ್ಚರಿಕೆಯಿಂದ ಸಮತೋಲನಗೊಳಿಸಿ, ಸಂಗ್ರಹಣೆಯ ಸವಾಲನ್ನು ಪರಿಹರಿಸಿದೆವು. ಈ ದಕ್ಷ ಗಾತ್ರದಲ್ಲೇ ಅತ್ಯಾಧುನಿಕ ನಿಖರತೆಯನ್ನು ಉಳಿಸಿಕೊಳ್ಳಲು, ಮರುಪಡೆಯುವಿಕೆ ಕಾರ್ಯಕ್ಷಮತೆ ಮತ್ತು ಸಂಗ್ರಹಣೆ ವೆಚ್ಚದ ಅತ್ಯುತ್ತಮ ಸಮತೋಲನಕ್ಕಾಗಿ ಆಯಾಮದ ಗಾತ್ರವನ್ನು 320 ಎಂದು ಎಚ್ಚರಿಕೆಯಿಂದ ಆಯ್ಕೆ ಮಾಡಿದೆವು.

    • ಆಧಾರಮಟ್ಟ: 10 ಲಕ್ಷ ಚಿತ್ರಗಳ ಎಂಬೆಡಿಂಗ್‌ಗಳನ್ನು ಸಂಗ್ರಹಿಸಲು ಪ್ರಮಾಣಿತ ವಿಧಾನಕ್ಕೆ (NVIDIA Nemo-3Bಯಂತೆ) ಸುಮಾರು 10.3 TB ಅಗತ್ಯವಿದೆ (1,802 ಟೋಕನ್‌ಗಳು @ 3,072 ಆಯಾಮಗಳು).

    • ColQwen3: ಅದೇ 10 ಲಕ್ಷ ಚಿತ್ರಗಳನ್ನು ಕೇವಲ 0.82 TBಯಲ್ಲಿ ಸಂಗ್ರಹಿಸುತ್ತದೆ (ಗರಿಷ್ಠ 1,280 ಟೋಕನ್‌ಗಳು @ 320 ಆಯಾಮಗಳು).

ಕ್ಲೌಡ್ ಮೂಲಸೌಕರ್ಯದ ವೆಚ್ಚವನ್ನು ಮಿತಿಮೀರಿ ಹೆಚ್ಚಿಸದೆ ColQwen3 ಅತ್ಯಾಧುನಿಕ ಮರುಪಡೆಯುವಿಕೆ ನಿಖರತೆಯನ್ನು ಸಾಧಿಸುತ್ತದೆ.

ಮೌಲ್ಯಮಾಪನ ಫಲಿತಾಂಶಗಳು

ನಾವು ನಮ್ಮ ವಿಧಾನವನ್ನು ViDoRe ಮಾನದಂಡಗಳ ಸಮೂಹದಲ್ಲಿ ಪರಿಶೀಲಿಸಿದೆವು. ಹಳೆಯ V1 ಕಾರ್ಯಗಳಲ್ಲಿ ಉನ್ನತ ಮಟ್ಟದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಉಳಿಸಿಕೊಂಡೇ, ಇತ್ತೀಚಿನ V3 ಮತ್ತು V2 ಮಾನದಂಡಗಳಲ್ಲಿ (ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಬಹುಭಾಷಾ ಎರಡರಲ್ಲೂ) ColQwen3 ಹೊಸ ಮಾನದಂಡಗಳನ್ನು ಸ್ಥಾಪಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ಫಲಿತಾಂಶಗಳು ದೃಢಪಡಿಸುತ್ತವೆ.

ViDoRe v3 (ಇತ್ತೀಚಿನದು)

ಇಂಗ್ಲಿಷ್ ಮತ್ತು ಬಹುಭಾಷಾ ಮರುಪಡೆಯುವಿಕೆಯಲ್ಲಿ ColQwen3-8B ಮುಂಚೂಣಿಯಲ್ಲಿದೆ.

ಇಂಗ್ಲಿಷ್ nDCG@5

ಮಾಡೆಲ್

ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನ

ಇಂಧನ

ಹಣಕಾಸು

ಮಾನವ ಸಂಪನ್ಮೂಲ

ಕೈಗಾರಿಕೆ

ಔಷಧೋದ್ಯಮ

ಭೌತಶಾಸ್ತ್ರ

ಸರಾಸರಿ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

ಬಹುಭಾಷಾ nDCG@5

ಮಾಡೆಲ್

ಕಂಪ್ಯೂಟರ್ ವಿಜ್ಞಾನ

ಇಂಧನ

ಹಣಕಾಸು

ಮಾನವ ಸಂಪನ್ಮೂಲ

ಕೈಗಾರಿಕೆ

ಔಷಧೋದ್ಯಮ

ಭೌತಶಾಸ್ತ್ರ

ಸರಾಸರಿ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 ಮತ್ತು v1 ಮುಖ್ಯಾಂಶಗಳು

ESG, ಅರ್ಥಶಾಸ್ತ್ರ ಮತ್ತು DocVQA ವಿಭಾಗಗಳಲ್ಲಿ ಸ್ಥಿರವಾದ ಉನ್ನತ ಕಾರ್ಯಕ್ಷಮತೆ.

ಮಾನದಂಡ

ಮಾಡೆಲ್

ಸ್ಕೋರ್ (ಸರಾಸರಿ)

ಗಮನಾರ್ಹ ಸಾಧನೆ

ViDoRe V2 (ಇಂಗ್ಲಿಷ್)

ColQwen3-8B

0.6772

ESG ಮತ್ತು BioMedನಲ್ಲಿ #1

ViDoRe V2 (ಬಹುಭಾಷಾ)

ColQwen3-8B

0.6085

ಅರ್ಥಶಾಸ್ತ್ರದಲ್ಲಿ #1

ViDoRe V1 (ಇಂಗ್ಲಿಷ್)

Nemo ColEmbed 3B

0.9100

ಸ್ವಲ್ಪ ಹೆಚ್ಚಿನ ಸರಾಸರಿ

ViDoRe V1 (ಇಂಗ್ಲಿಷ್)

ColQwen3-8B

0.9076

ArxivQA ಮತ್ತು Syn-Govನಲ್ಲಿ #1

ವೀಡಿಯೊ ಮರುಪಡೆಯುವಿಕೆ: CareBench ಮೌಲ್ಯಮಾಪನ

ವೀಡಿಯೊ ಮರುಪಡೆಯುವಿಕೆಗೂ ColQwen3 ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಸಾಮಾನ್ಯೀಕರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸಲು, ಪಠ್ಯದಿಂದ ವೀಡಿಯೊಗೆ (ಸಾಮಾನ್ಯ ಮರುಪಡೆಯುವಿಕೆ) ಸಂಬಂಧಿಸಿದ ಕಾರ್ಯಗಳಿಗಾಗಿ CareBench ಮಾನದಂಡದಲ್ಲಿ ಮಾಡೆಲ್‌ಗಳನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿದೆವು.

ಈ ಮೌಲ್ಯಮಾಪನಕ್ಕಾಗಿ ನಾವು ಕಚ್ಚಾ ವೀಡಿಯೊ ಎನ್‌ಕೋಡಿಂಗ್ ವಿಧಾನವನ್ನು ಬಳಸಿದೆವು: ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಪಠ್ಯ ಟಿಪ್ಪಣಿಗಳು ಅಥವಾ ಮೆಟಾಡೇಟಾ ಇನ್‌ಪುಟ್‌ಗಳಿಲ್ಲದೆ ನಮ್ಮ ಮಾಡೆಲ್‌ಗಳು ವೀಡಿಯೊ ಫೈಲ್‌ಗಳನ್ನು ನೇರವಾಗಿ ಎನ್‌ಕೋಡ್ ಮಾಡಿದವು. ಸಂಪೂರ್ಣವಾಗಿ ದೃಶ್ಯಾರ್ಥದ ಆಧಾರದ ಮೇಲೆ ಮರುಪಡೆಯುವಿಕೆ ನಡೆಸುವ ಮಾಡೆಲ್‌ನ ಸಾಮರ್ಥ್ಯವನ್ನು ಇದು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ.

ಮಾಡೆಲ್

ಮರುಪಡೆಯುವಿಕೆ@1

ಮರುಪಡೆಯುವಿಕೆ@5

ಮರುಪಡೆಯುವಿಕೆ@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“ಅಜ್ಞಾತ ದತ್ತಾಂಶ”ವನ್ನು ಬಳಕೆಗೆ ತೆರೆಯುವುದು: ವೀಡಿಯೊದ ಅತ್ಯಾಧುನಿಕ ಕ್ಷೇತ್ರ

ವೀಡಿಯೊವನ್ನೂ ದಾಖಲೆಗಳಂತೆಯೇ ಪರಿಗಣಿಸುವ ColQwen3 ಸಾಮರ್ಥ್ಯವು ಅದು ಸಾಧ್ಯವಾಗಿಸಿರುವ ಅತ್ಯಂತ ಮಹತ್ವದ ಬದಲಾವಣೆಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ. ಅನೇಕ ಉದ್ಯಮಗಳಲ್ಲಿ ವೀಡಿಯೊ “ಅಜ್ಞಾತ ದತ್ತಾಂಶ”ವಾಗಿದೆ. ಪ್ರತಿಯೊಂದು ಫೈಲ್‌ಗೂ ಯಾರಾದರೂ ಕೈಯಾರೆ ಟ್ಯಾಗ್ ಮಾಡದಿದ್ದರೆ, ಅದು ಹುಡುಕಲಾಗದ ಸ್ಥಿತಿಯಲ್ಲಿ ಕೋಲ್ಡ್ ಸ್ಟೋರೇಜ್‌ನಲ್ಲೇ ಉಳಿಯುತ್ತದೆ.

ವಿಭಜಿಸಿದ ಕ್ಲಿಪ್‌ಗಳಲ್ಲಿ ಫ್ರೇಮ್‌ವಾರು ಮರುಪಡೆಯುವಿಕೆಯನ್ನು ಸಾಧ್ಯವಾಗಿಸುವ ಮೂಲಕ ColQwen3 ಇದನ್ನು ಬದಲಾಯಿಸುತ್ತದೆ.

ಬಳಕೆಯ ಉದಾಹರಣೆ: ಸಂಸ್ಥೆಯ ಸ್ಮೃತಿ ಭಂಡಾರ

ಉದ್ಯಮಗಳು ಪ್ರತಿದಿನ ಸಾವಿರಾರು ಗಂಟೆಗಳ ಆಂತರಿಕ ವೀಡಿಯೊ ಸಭೆಗಳನ್ನು ದಾಖಲಿಸುತ್ತವೆ; ಸಾಮಾನ್ಯವಾಗಿ ಈ ರೆಕಾರ್ಡಿಂಗ್‌ಗಳು ಯಾರಿಗೂ ಸಿಗದೆ ಕಣ್ಮರೆಯಾಗುತ್ತವೆ.

  • ಕಾರ್ಯವಿಧಾನ: ದೀರ್ಘ ಸಭೆಯ ರೆಕಾರ್ಡಿಂಗ್‌ಗಳನ್ನು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಚಿಕ್ಕದಾದ, ತಾರ್ಕಿಕ ಕ್ಲಿಪ್‌ಗಳಾಗಿ ವಿಭಜಿಸಿ, ಅವುಗಳನ್ನು ColQwen3 ಮೂಲಕ ಸೂಚ್ಯಂಕೀಕರಿಸಿದರೆ ಹುಡುಕಬಹುದಾದ “ಸಂಸ್ಥೆಯ ಸ್ಮೃತಿ” ರೂಪುಗೊಳ್ಳುತ್ತದೆ.

  • ಪ್ರಶ್ನೆ: ಯೋಜನಾ ವ್ಯವಸ್ಥಾಪಕರು ಹೀಗೆ ಕೇಳಬಹುದು: “APIಯ ವಿಳಂಬ ಸಮಸ್ಯೆಯನ್ನು ಎಂಜಿನಿಯರಿಂಗ್ ಮುಖ್ಯಸ್ಥರು ವಿವರಿಸಿದ ಕ್ಲಿಪ್ ತೋರಿಸಿ.”

  • ಫಲಿತಾಂಶ: 60 ನಿಮಿಷಗಳ ವೀಡಿಯೊ ಫೈಲ್ ಅನ್ನು ಹಿಂದಿರುಗಿಸುವ ಬದಲು, ಆ ನಿರ್ದಿಷ್ಟ ರೇಖಾಚಿತ್ರವನ್ನು ಪರದೆಯಲ್ಲಿ ತೋರಿಸಿ ಚರ್ಚಿಸಿದ ನಿಖರವಾದ 45 ಸೆಕೆಂಡುಗಳ ಭಾಗವನ್ನು ವ್ಯವಸ್ಥೆ ಮರುಪಡೆಯುತ್ತದೆ. ಆ ಕ್ಷಣದಲ್ಲಿ ಮಾತನಾಡಿದವರು “ವಿಳಂಬ” ಎಂಬ ಪದವನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಹೇಳದಿದ್ದರೂ ಇದು ಸಾಧ್ಯ.

ಉದ್ಯಮ ಬಳಕೆಯ ಉದಾಹರಣೆಗಳು: ಹೆಚ್ಚಿನ ಮೌಲ್ಯದ ಸಮಸ್ಯೆಗಳಿಗೆ ಪರಿಹಾರ

ಸ್ಥಳೀಯ ಬಹುಮಾಧ್ಯಮ ಎಂಬೆಡಿಂಗ್‌ಗೆ ಬದಲಾಗುವುದರಿಂದ ವಿವಿಧ ಉದ್ಯಮಗಳಲ್ಲಿ ಸಂಪೂರ್ಣ ಹೊಸ ಕಾರ್ಯವಿಧಾನಗಳು ಸಾಧ್ಯವಾಗುತ್ತವೆ. ಕೆಲವು ಅತ್ಯಂತ ಸಂಕೀರ್ಣ ಉದ್ಯಮ ದತ್ತಾಂಶ ಪರಿಸರಗಳಿಗೆ ಹೋಲಿಸಿ ನಾವು ಈ ಮಾಡೆಲ್ ಅನ್ನು ವ್ಯಾಪಕವಾಗಿ ಮಾನದಂಡ ಪರೀಕ್ಷೆಗೆ ಒಳಪಡಿಸಿದ್ದೇವೆ.

1. ಮಾನದಂಡದ ಮುಖ್ಯಾಂಶ: ನಗರ ಸಮಾಲೋಚನೆ ಮತ್ತು ವಾಸ್ತುಶಿಲ್ಪ

ಮಹಾಯೋಜನೆಗಳು, ವಲಯ ನಕ್ಷೆಗಳು ಮತ್ತು ಸಂಕೀರ್ಣ ವಾಸ್ತುಶಿಲ್ಪೀಯ ಎಲಿವೇಶನ್‌ಗಳ ಬೃಹತ್ ಸಂಗ್ರಹಗಳನ್ನು ನಿರ್ವಹಿಸುವ ನಗರ ಸಮಾಲೋಚನಾ ಸಂಸ್ಥೆಗಳು ಎದುರಿಸುವ ದತ್ತಾಂಶ ಸವಾಲುಗಳಲ್ಲಿ ನಾವು ColQwen3 ಅನ್ನು ಪರೀಕ್ಷಿಸಿದೆವು.

  • ಸವಾಲು: ಇಂತಹ ಪರಿಸರಗಳಲ್ಲಿ ಸಾಂಪ್ರದಾಯಿಕ RAG ಪೈಪ್‌ಲೈನ್‌ಗಳು ಸಮರ್ಥವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುವುದಿಲ್ಲ. OCR ಸಾಧನಗಳು ಸಾಮಾನ್ಯವಾಗಿ ಸಂಕೀರ್ಣ ನಿವೇಶನ ಯೋಜನೆಗಳನ್ನು ಕೇವಲ “ರೇಖಾಚಿತ್ರ” ಎಂದು ವಿವರಿಸುತ್ತವೆ; ಸಂಚಾರ ಹರಿವು, ಹಸಿರು ವಲಯಗಳು ಅಥವಾ ಕಟ್ಟಡದ ಹಿನ್ನಡೆ ಅಂತರಗಳಂತಹ ನಿರ್ಣಾಯಕ ವಿವರಗಳು ಇದರಿಂದ ತಪ್ಪಿಹೋಗುತ್ತವೆ.

  • ಕಾರ್ಯಕ್ಷಮತೆ: ದುಬಾರಿ OCR/ವಿವರಣೆ ಪೂರ್ವಸಂಸ್ಕರಣೆಯ ಅಗತ್ಯವನ್ನು ColQwen3 ಪರಿಣಾಮಕಾರಿಯಾಗಿ ನಿವಾರಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ನಮ್ಮ ಆಂತರಿಕ ಮಾನದಂಡಗಳು ತೋರಿಸುತ್ತವೆ. ದಟ್ಟವಾದ ವಾಸ್ತುಶಿಲ್ಪೀಯ ರೇಖಾಚಿತ್ರಗಳ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಪಾದಚಾರಿ ಪ್ರವೇಶ ಬಿಂದುಗಳು ಅಥವಾ ವಿಭಿನ್ನ ವಲಯ ಗಡಿಗಳಂತಹ ನಿರ್ದಿಷ್ಟ ದೃಶ್ಯ ಗುರುತುಗಳ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ದಾಖಲೆಗಳನ್ನು ಯಶಸ್ವಿಯಾಗಿ ಮರುಪಡೆಯಿತು. ಇದು ಪಠ್ಯ-ಮಾತ್ರದ ಆಧಾರಮಟ್ಟಗಳನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಮೀರಿಸುವುದರ ಜೊತೆಗೆ ಜ್ಞಾನ ಅಳವಡಿಕೆ ವೆಚ್ಚವನ್ನು ಭಾರಿ ಪ್ರಮಾಣದಲ್ಲಿ ಕಡಿಮೆ ಮಾಡುವ ಭರವಸೆ ನೀಡುತ್ತದೆ.

2. ಸಂಕೀರ್ಣ ಹಣಕಾಸು ಮತ್ತು ಮಾರುಕಟ್ಟೆ ಇಂಟೆಲಿಜೆನ್ಸ್

ಹೂಡಿಕೆ ಬ್ಯಾಂಕರ್‌ಗಳು ಮತ್ತು ವಿಶ್ಲೇಷಕರು ವಾರ್ಷಿಕ ವರದಿಗಳು ಹಾಗೂ ಹೂಡಿಕೆದಾರರ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳನ್ನು ಪರಿಶೀಲಿಸಲು ಸಾವಿರಾರು ಗಂಟೆಗಳನ್ನು ವ್ಯಯಿಸುತ್ತಾರೆ.

  • ಕಾರ್ಯವಿಧಾನ: ವಿಶ್ಲೇಷಕರು ಹೀಗೆ ಕೇಳಬಹುದು: “2024ರ ಸ್ಲೈಡ್ ಸಂಗ್ರಹಗಳಿಂದ APAC ಆದಾಯ ಮತ್ತು EMEA ಆದಾಯದ ವಿವರವಾದ ಹೋಲಿಕೆಯನ್ನು ಹುಡುಕಿ.”

  • ಬದಲಾವಣೆ: ಕೀವರ್ಡ್ ಹೊಂದಾಣಿಕೆಗಳನ್ನು ಅವಲಂಬಿಸುವ ಬದಲು, ನಿರ್ದಿಷ್ಟ ದತ್ತಾಂಶ ದೃಶ್ಯೀಕರಣವು ದೃಶ್ಯವಾಗಿ ಇರುವುದರ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ನಿಖರವಾದ ಸ್ಲೈಡ್ ಅನ್ನು ಮರುಪಡೆಯುತ್ತದೆ. ಇದರಿಂದ RAG ವ್ಯವಸ್ಥೆಯು ಪ್ರಶ್ನೆಗಳಿಗೆ ಹೆಚ್ಚಿನ ನಿಖರತೆಯಿಂದ ಉತ್ತರಿಸಬಹುದು.

3. ಕೈಗಾರಿಕಾ ಉತ್ಪಾದನೆ ಮತ್ತು ಕ್ಷೇತ್ರ ಸೇವೆ

ಉತ್ಪಾದನಾ ಸಂಸ್ಥೆಗಳು ತಾಂತ್ರಿಕ ಕೈಪಿಡಿಗಳು ಮತ್ತು ಪೈಪಿಂಗ್ ರೇಖಾಚಿತ್ರಗಳ (P&IDಗಳು) ಬೃಹತ್ ಸಂಗ್ರಹಗಳನ್ನು ಹೊಂದಿವೆ.

  • ಕಾರ್ಯವಿಧಾನ: ಟರ್ಬೈನ್ ದುರಸ್ತಿ ಮಾಡುವ ಕ್ಷೇತ್ರ ಎಂಜಿನಿಯರ್ ಒಂದು ಭಾಗದ ಚಿತ್ರ ತೆಗೆದುಕೊಳ್ಳಬಹುದು ಅಥವಾ “ಹೈಡ್ರಾಲಿಕ್ ಪಂಪ್ ಜೋಡಣೆಯ ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರವನ್ನು ತೋರಿಸಿ.” ಎಂದು ಕೇಳಬಹುದು.

  • ಬದಲಾವಣೆ: ವೈರಿಂಗ್ ರೇಖಾಚಿತ್ರದ ದೃಶ್ಯ ನಿರೂಪಣೆಯನ್ನು ColQwen3 ಗುರುತಿಸಿ ಸರಿಯಾದ ಪುಟವನ್ನು ಮರುಪಡೆಯುತ್ತದೆ. ಇದರಿಂದ ಕಾರ್ಯಸ್ಥಗಿತದ ಅವಧಿಯನ್ನು ಹಲವು ಗಂಟೆಗಳಷ್ಟು ಕಡಿಮೆ ಮಾಡಬಹುದು.

4. ಕಾನೂನು ಮತ್ತು ಅನುಸರಣೆ

ಕಾನೂನು ಶೋಧನೆಯಲ್ಲಿ ಲಕ್ಷಾಂತರ ಸ್ಕ್ಯಾನ್ ಮಾಡಿದ ಪುಟಗಳನ್ನು ಪರಿಶೀಲಿಸಬೇಕಾಗುತ್ತದೆ; ಅವುಗಳಲ್ಲಿ ಹುಡುಕಬೇಕಾದ ಮುಖ್ಯ ಅಂಶವು ಅನೇಕ ಬಾರಿ ದೃಶ್ಯ ಗುರುತಾಗಿರುತ್ತದೆ.

  • ಕಾರ್ಯವಿಧಾನ: ಅನುಸರಣೆ ಅಧಿಕಾರಿ “ಮುಖ್ಯ ಹಣಕಾಸು ಅಧಿಕಾರಿ ಸಹಿ ಮಾಡಿದ ದಾಖಲೆಗಳು” ಅಥವಾ “ಅಧಿಕೃತ ‘ಗೌಪ್ಯ’ ಮುದ್ರೆಯಿರುವ ಒಪ್ಪಂದಗಳು” ಎಂದು ಹುಡುಕಬಹುದು.

  • ಬದಲಾವಣೆ: ಸಹಿಗಳು ಅಥವಾ ಮುದ್ರೆಗಳು ದೃಶ್ಯವಾಗಿ ಇರುವುದರ ಆಧಾರದ ಮೇಲೆ ಮಾಡೆಲ್ ಕರಡು ಮತ್ತು ಅಂತಿಮಗೊಳಿಸಿದ ದಾಖಲೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸ ಗುರುತಿಸುತ್ತದೆ. ಕೇವಲ OCR ಬಳಸಿದಾಗ ಇದು ಹೆಚ್ಚಾಗಿ ತಪ್ಪಿಹೋಗುತ್ತದೆ.

ಪ್ರಾರಂಭಿಸುವುದು

ColQwen3 ಮುಕ್ತ ತೂಕಗಳನ್ನು ಹೊಂದಿದೆ (Apache 2.0) ಮತ್ತು ಈಗ Hugging Faceನಲ್ಲಿ ಲಭ್ಯವಿದೆ. ಆಧುನಿಕ RAG ಪೈಪ್‌ಲೈನ್‌ಗಳಿಗೆ ನೇರವಾಗಿ ಅಳವಡಿಸಬಹುದಾದ ಉನ್ನತೀಕರಣವಾಗಿ ಇದನ್ನು ವಿನ್ಯಾಸಗೊಳಿಸಿದ್ದೇವೆ. ಪಠ್ಯ, ಚಿತ್ರಗಳು ಮತ್ತು ವೀಡಿಯೊವನ್ನು ತಕ್ಷಣ ಸಂಸ್ಕರಿಸಲು ಬೇಕಾದ ನಿರ್ಣಯ ಸಂಕೇತವೂ ಇದರಲ್ಲಿದೆ.

ಸರಳ ಪಠ್ಯ ಹುಡುಕಾಟವನ್ನು ಮೀರಿ, ತಮ್ಮ ದೃಶ್ಯ ಸಂಪನ್ಮೂಲಗಳಲ್ಲಿ ಅಡಗಿರುವ ತಿಳಿವಳಿಕೆಯನ್ನು ಬಳಕೆಗೆ ತೆರೆಯಲು ಸಿದ್ಧವಾಗಿರುವ ಉದ್ಯಮಗಳಿಗೆ ಇದು ಹೊಸ ಮಾನದಂಡವಾಗಿದೆ.

ಮುಂದಿನ ಹೆಜ್ಜೆ: ಮಾಡೆಲ್ ಕಾರ್ಡ್ ನೋಡಿ ಮತ್ತು Hugging Faceನಲ್ಲಿ ನೇರ ಪ್ರದರ್ಶನವನ್ನು ಪ್ರಯತ್ನಿಸಿ: /-colqwen3-embed-8b ಮತ್ತು /-colqwen3-embed-4b

ಲೇಖಕ

Xin Huang, Kye Min Tan