Τα τελευταία δύο χρόνια, το «RAG» (Retrieval-Augmented Generation) ήταν σχεδόν αποκλειστικά συνώνυμο με το κείμενο. Η συνήθης πρακτική είναι απλή: παίρνεις τα έγγραφα, εξάγεις το κείμενο, το χωρίζεις σε τμήματα και δημιουργείς ευρετήριο.
Ωστόσο, ο επιχειρηματικός κόσμος δεν βασίζεται σε αρχεία απλού κειμένου. Βασίζεται σε σύνθετα PDF, παρουσιάσεις με πυκνά γραφήματα, σχέδια CAD, σαρωμένα τιμολόγια και, όλο και περισσότερο, τεράστια αρχεία βίντεο.
Η καθιερωμένη πρακτική χρήσης OCR ή Vision LLM για τη μετατροπή μιας εικόνας σε κείμενο μέσω «λεζάντας» πριν από την ενσωμάτωσή της αποτελεί τεράστιο σημείο συμφόρησης. Είναι αργή και δαπανηρή και αναπόφευκτα χάνει το πλούσιο χωρικό και οπτικό πλαίσιο των αρχικών δεδομένων. Αν η τεχνητή νοημοσύνη περιγράψει μια σύνθετη εικόνα απλώς ως «σχέδιο», χάνετε τη δυνατότητα αναζήτησης της συγκεκριμένης βαλβίδας ή του διαγράμματος καλωδίωσης που περιέχει.
Σήμερα κυκλοφορούμε μια οικογένεια υπερσύγχρονων μοντέλων πολυτροπικών ενσωματώσεων, τα οποία βασίζονται στην αρχιτεκτονική ColPali και έχουν σχεδιαστεί για να λύσουν αυτό το πρόβλημα, επιτρέποντας διατερματική οπτική ανάκτηση.
Η δημιουργία ενός πραγματικά αποτελεσματικού πολυτροπικού συστήματος ανάκτησης δεν είναι τόσο απλή όσο η χρήση ενός έτοιμου μοντέλου όρασης-γλώσσας (VLM) για αναζήτηση. Για να αντιμετωπίσουμε τις προκλήσεις που ιστορικά περιόριζαν το πολυτροπικό RAG και να δημιουργήσουμε το ColQwen3, χρησιμοποιήσαμε στρατηγικές συγχώνευσης και εκπαίδευσης μοντέλων.
Αντί να ρυθμίσουμε λεπτομερώς ένα βασικό μοντέλο από την αρχή, αναπτύξαμε μια μέθοδο μεταφοράς της γνώσης των εργασιών ανάκτησης από ένα υπάρχον μοντέλο ενσωματώσεων κειμένου. Ένα τυπικό VLM γνωρίζει πώς να περιγράφει εικόνες, αλλά όχι απαραίτητα πώς να τις κατατάσσει σημασιολογικά σε σχέση με ένα ερώτημα.
Για να γεφυρώσουμε αυτό το χάσμα, χρησιμοποιήσαμε στρατηγικές ρυθμισμένης στάθμισης συγχώνευσης. Στα πειράματά μας διαπιστώσαμε ότι η δυνατότητα ανάκτησης του Qwen3-Embedding στον λανθάνοντα χώρο κειμένου μπορούσε να μεταφερθεί απευθείας στον πολυτροπικό χώρο, με γενίκευση στην ανάκτηση εικόνων και βίντεο ακόμη και χωρίς άμεση εκπαίδευση. Αξιοποιώντας αυτήν την αποτελεσματική αρχικοποίηση ως ισχυρό σημείο εκκίνησης, προχωρήσαμε σε λεπτομερή ρύθμιση του μοντέλου, ώστε να βελτιστοποιήσουμε περαιτέρω τις επιδόσεις και να διασφαλίσουμε την ανθεκτικότητά του. Βελτιώνει την τελική επίδοση ανάκτησης σε σύγκριση με τη λεπτομερή ρύθμιση από το βασικό μοντέλο Qwen3-VL.
Αφού μεταφέραμε τις δυνατότητες ενσωμάτωσης, επικεντρωθήκαμε στην ευθυγράμμιση. Πραγματοποιήσαμε προσεκτικές αναζητήσεις υπερπαραμέτρων και μελέτες κατάλυσης, εξετάζοντας τον βέλτιστο αριθμό εποχών, το μέγεθος παρτίδας, τον ρυθμό μάθησης, την τάξη LoRA και τον συνδυασμό συνόλων δεδομένων, ώστε να μεγιστοποιήσουμε την επίδοση ανάκτησης.
Ως σύνολα δεδομένων λεπτομερούς ρύθμισης επιλέξαμε τα VDR, ColPali train set, visrag_syn, και visrag_ind. Χρησιμοποιήσαμε δειγματοληψία UniMax για τη λεπτομερή ρύθμιση. Επειδή εφαρμόσαμε συγχώνευση μοντέλων και το βασικό συγχωνευμένο μοντέλο κληρονομεί ήδη μέρος της πολυτροπικής δυνατότητας ανάκτησης, διαπιστώσαμε ότι η προσθήκη περισσότερων συνόλων δεδομένων υποβάθμιζε ελαφρώς τις επιδόσεις. Γι’ αυτό δεν επεκταθήκαμε σε περισσότερα σύνολα δεδομένων.
Αυτές είναι οι υπερπαράμετροι που επιλέξαμε για τη λεπτομερή ρύθμιση:
Τάξη LoRA | 32 |
Άλφα LoRA | 32 |
Μονάδες-στόχοι LoRA | όλα τα επίπεδα εικόνας και κειμένου, εκτός από την ενσωμάτωση |
Ρυθμός μάθησης | 5e-5 |
Μέγιστος αριθμός οπτικών token | 1280 |
Εποχές εκπαίδευσης | 1 |
Συνολικό μέγεθος παρτίδας | 512 |
Αναλογία προθέρμανσης | 5% |
Ιστορικά, τα μοντέλα που χρησιμοποιούσαν ενσωματώσεις σε επίπεδο token «τύπου ColBERT» (όπως το ColPali) πρόσφεραν εντυπωσιακές επιδόσεις, αλλά με απαγορευτικό κόστος αποθήκευσης. Η δημιουργία ευρετηρίου για κάθε οπτικό token παρήγαγε τεράστιες διανυσματικές βάσεις δεδομένων, υπερβολικά ακριβές για χρήση σε επιχειρηματική κλίμακα.
Η στρατηγική βελτιστοποίησης: Αντιμετωπίσαμε την πρόκληση της αποθήκευσης εξισορροπώντας προσεκτικά το μέγεθος των ενσωματώσεών μας, ώστε να διατηρήσουμε τις μέγιστες επιδόσεις χωρίς εκτόξευση του κόστους. Για να διατηρήσουμε ακρίβεια SOTA με αυτό το αποδοτικό αποτύπωμα, επιλέξαμε προσεκτικά μέγεθος 320 διαστάσεων, ώστε να πετύχουμε την καλύτερη ισορροπία μεταξύ επίδοσης ανάκτησης και κόστους αποθήκευσης.
Βασική προσέγγιση: Μια τυπική λύση (όπως το NVIDIA Nemo-3B) απαιτεί περίπου 10,3 TB για την αποθήκευση ενσωματώσεων 1 εκατομμυρίου εικόνων (1.802 token @ 3.072 διαστάσεις).
ColQwen3: Αποθηκεύει το ίδιο 1 εκατομμύριο εικόνες σε μόλις 0,82 TB (έως 1.280 token @ 320 διαστάσεις).
Το ColQwen3 επιτυγχάνει ακρίβεια ανάκτησης SOTA χωρίς να εκτοξεύει τον προϋπολογισμό των υποδομών cloud.
Επικυρώσαμε την προσέγγισή μας στη σουίτα benchmark ViDoRe. Τα αποτελέσματα επιβεβαιώνουν ότι το ColQwen3 θέτει νέα πρότυπα στα πιο πρόσφατα benchmark V3 και V2 (τόσο στα αγγλικά όσο και σε πολλές γλώσσες), διατηρώντας κορυφαίες επιδόσεις στις παλαιότερες δοκιμές V1.
Το ColQwen3-8B προηγείται στην ανάκτηση στα αγγλικά και σε πολλές γλώσσες.
Αγγλικό nDCG@5
Μοντέλο | Πληροφορική | Ενέργεια | Χρηματοοικονομικά | Ανθρώπινο δυναμικό | Βιομηχανία | Φαρμακευτική | Φυσική | Μ.ό. |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
Πολυγλωσσικό nDCG@5
Μοντέλο | Πληροφορική | Ενέργεια | Χρηματοοικονομικά | Ανθρώπινο δυναμικό | Βιομηχανία | Φαρμακευτική | Φυσική | Μ.ό. |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
Σταθερά υψηλές επιδόσεις στα ESG, Economics και DocVQA.
Benchmark | Μοντέλο | Βαθμολογία (Μ.ό.) | Αξιοσημείωτη πρωτιά |
ViDoRe V2 (Αγγλικά) | ColQwen3-8B | 0.6772 | #1 στα ESG & BioMed |
ViDoRe V2 (Πολυγλωσσικό) | ColQwen3-8B | 0.6085 | #1 στα Οικονομικά |
ViDoRe V1 (Αγγλικά) | Nemo ColEmbed 3B | 0.9100 | Ελαφρώς υψηλότερος μέσος όρος |
ViDoRe V1 (Αγγλικά) | ColQwen3-8B | 0.9076 | #1 στα ArxivQA & Syn-Gov |
Για να δείξουμε ότι το ColQwen3 γενικεύει αποτελεσματικά στην ανάκτηση βίντεο, αξιολογήσαμε τα μοντέλα στο benchmark CareBench για εργασίες μετατροπής κειμένου σε βίντεο (Γενική ανάκτηση).
Για αυτήν την αξιολόγηση χρησιμοποιήσαμε μια προσέγγιση κωδικοποίησης ακατέργαστου βίντεο: τα μοντέλα μας κωδικοποίησαν απευθείας τα αρχεία βίντεο, χωρίς πρόσθετες σχολιαστικές επισημάνσεις κειμένου ή μεταδεδομένα. Αυτό αναδεικνύει την ικανότητα του μοντέλου να εκτελεί ανάκτηση αποκλειστικά βάσει της οπτικής σημασιολογίας.
Μοντέλο | Ανάκληση@1 | Ανάκληση@5 | Ανάκληση@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
Μία από τις πιο ουσιαστικές αλλαγές που επιτρέπει το ColQwen3 είναι η δυνατότητά του να χειρίζεται το βίντεο όπως ακριβώς τα έγγραφα. Σε πολλές επιχειρήσεις, το βίντεο αποτελεί «σκοτεινά δεδομένα». Παραμένει σε ψυχρή αποθήκευση και δεν μπορεί να αναζητηθεί, εκτός αν κάποιος έχει προσθέσει χειροκίνητα ετικέτες σε κάθε αρχείο.
Το ColQwen3 το αλλάζει αυτό, επιτρέποντας ανάκτηση ανά καρέ σε τμηματοποιημένα αποσπάσματα.
Καθημερινά, οι επιχειρήσεις καταγράφουν χιλιάδες ώρες εσωτερικών βιντεοσυσκέψεων και, συνήθως, αυτές οι εγγραφές χάνονται στο κενό.
Η ροή εργασίας: Τμηματοποιώντας αυτόματα τις πολύωρες εγγραφές συσκέψεων σε συντομότερα, λογικά αποσπάσματα και δημιουργώντας ευρετήριο με το ColQwen3, δημιουργείτε μια αναζητήσιμη «εταιρική μνήμη».
Το ερώτημα: Ένας διαχειριστής έργου μπορεί να ζητήσει: “Show me the clip where the engineering lead explained the latency issue with the API.”
Το αποτέλεσμα: Αντί να επιστρέψει ένα αρχείο βίντεο 60 λεπτών, το σύστημα ανακτά ακριβώς το απόσπασμα των 45 δευτερολέπτων στο οποίο το συγκεκριμένο διάγραμμα προβλήθηκε στην οθόνη και συζητήθηκε, ακόμη κι αν οι ομιλητές δεν είπαν ρητά τη λέξη «καθυστέρηση» εκείνη ακριβώς τη στιγμή.
Η μετάβαση σε εγγενείς πολυτροπικές ενσωματώσεις καθιστά δυνατές εντελώς νέες ροές εργασίας σε κάθε κλάδο. Έχουμε αξιολογήσει εκτενώς αυτό το μοντέλο σε ορισμένα από τα πιο σύνθετα περιβάλλοντα εταιρικών δεδομένων.
Δοκιμάσαμε το ColQwen3 στις προκλήσεις δεδομένων που αντιμετωπίζουν οι εταιρείες πολεοδομικών συμβούλων, οι οποίες διαχειρίζονται τεράστιες βιβλιοθήκες γενικών σχεδίων, χαρτών χρήσεων γης και σύνθετων αρχιτεκτονικών όψεων.
Η πρόκληση: Σε αυτά τα περιβάλλοντα, οι συμβατικές διοχετεύσεις RAG δυσκολεύονται. Τα εργαλεία OCR συνήθως περιγράφουν σύνθετα τοπογραφικά σχέδια απλώς ως «σχηματικά διαγράμματα», παραβλέποντας κρίσιμες λεπτομέρειες για τη ροή της κυκλοφορίας, τις ζώνες πρασίνου ή τις αποστάσεις των κτιρίων από τα όρια.
Οι επιδόσεις: Τα εσωτερικά benchmark μας δείχνουν ότι το ColQwen3 παρακάμπτει αποτελεσματικά την ανάγκη για δαπανηρή προεπεξεργασία OCR/δημιουργίας λεζάντας. Σε δοκιμές με πυκνά αρχιτεκτονικά σχέδια, το μοντέλο ανέκτησε επιτυχώς έγγραφα βάσει συγκεκριμένων οπτικών δεικτών, όπως σημεία πρόσβασης πεζών ή διακριτά όρια χρήσεων γης, υπερβαίνοντας σημαντικά τις βασικές λύσεις μόνο με κείμενο και υποσχόμενο δραστική μείωση του κόστους εισαγωγής γνώσης.
Οι επενδυτικοί τραπεζίτες και οι αναλυτές αφιερώνουν χιλιάδες ώρες στην εξέταση ετήσιων εκθέσεων και παρουσιάσεων προς επενδυτές.
Η ροή εργασίας: Ένας αναλυτής μπορεί να ζητήσει: “Find the breakdown of APAC revenue vs. EMEA revenue from the 2024 slide decks.”
Η αλλαγή: Αντί να βασίζεται στην αντιστοίχιση λέξεων-κλειδιών, το μοντέλο ανακτά την ακριβή διαφάνεια με βάση την οπτική παρουσία της συγκεκριμένης απεικόνισης δεδομένων, επιτρέποντας στο σύστημα RAG να απαντά σε ερωτήσεις με μεγάλη ακρίβεια.
Οι μεταποιητικές επιχειρήσεις διαθέτουν τεράστιες βιβλιοθήκες τεχνικών εγχειριδίων και διαγραμμάτων σωληνώσεων και οργάνων (P&ID).
Η ροή εργασίας: Ένας τεχνικός πεδίου που επισκευάζει έναν στρόβιλο μπορεί να φωτογραφίσει ένα εξάρτημα ή να ζητήσει: “Show me the wiring diagram for the hydraulic pump assembly.”
Η αλλαγή: Το ColQwen3 αναγνωρίζει την οπτική αναπαράσταση του διαγράμματος καλωδίωσης και ανακτά τη σωστή σελίδα, μειώνοντας ενδεχομένως τον χρόνο διακοπής λειτουργίας κατά ώρες.
Η διαδικασία αναζήτησης νομικών στοιχείων απαιτεί την εξέταση εκατομμυρίων σαρωμένων σελίδων, όπου το δυσεύρετο στοιχείο είναι συχνά ένας οπτικός δείκτης.
Η ροή εργασίας: Ένας υπεύθυνος συμμόρφωσης μπορεί να αναζητήσει “Documents signed by the CFO” ή “Contracts containing the official ‘Confidential’ stamp.”
Η αλλαγή: Το μοντέλο διακρίνει ένα προσχέδιο από ένα οριστικοποιημένο έγγραφο βάσει της οπτικής παρουσίας υπογραφών ή σφραγίδων, κάτι που συχνά διαφεύγει από το αμιγές OCR.
Το ColQwen3 διαθέτει ανοικτά βάρη (Apache 2.0) και είναι ήδη διαθέσιμο στο Hugging Face. Το σχεδιάσαμε ως άμεση αναβάθμιση για σύγχρονες διοχετεύσεις RAG, παρέχοντας τον απαραίτητο κώδικα συμπερασμού για την άμεση επεξεργασία κειμένου, εικόνων και βίντεο.
Για τις επιχειρήσεις που είναι έτοιμες να υπερβούν την απλή αναζήτηση κειμένου και να αξιοποιήσουν την ευφυΐα που παραμένει εγκλωβισμένη στο οπτικό υλικό τους, αυτό είναι το νέο πρότυπο.
Επόμενο βήμα: Εξερευνήστε την κάρτα μοντέλου και δοκιμάστε τη ζωντανή επίδειξη στο Hugging Face: /-colqwen3-embed-8b και /-colqwen3-embed-4b