ਪਿਛਲੇ ਦੋ ਸਾਲਾਂ ਤੋਂ “RAG” (ਪ੍ਰਾਪਤੀ-ਵਧਾਈ ਉਤਪੱਤੀ) ਲਗਭਗ ਪੂਰੀ ਤਰ੍ਹਾਂ ਟੈਕਸਟ ਦਾ ਸਮਾਨਾਰਥੀ ਰਿਹਾ ਹੈ. ਮਿਆਰੀ ਤਰੀਕਾ ਸੌਖਾ ਹੈ: ਦਸਤਾਵੇਜ਼ ਲਓ, ਟੈਕਸਟ ਕੱਢੋ, ਉਸ ਦੇ ਭਾਗ ਬਣਾਓ ਅਤੇ ਸੂਚੀਬੱਧ ਕਰੋ.
ਪਰ ਉੱਦਮੀ ਜਗਤ ਸਿਰਫ਼ ਸਾਦੀਆਂ ਟੈਕਸਟ ਫ਼ਾਈਲਾਂ ਉੱਤੇ ਨਹੀਂ ਚੱਲਦਾ. ਇਹ ਜਟਿਲ PDF, ਸੰਘਣੇ ਚਾਰਟਾਂ ਵਾਲੀਆਂ ਸਲਾਈਡ ਪੇਸ਼ਕਾਰੀਆਂ, CAD ਚਿੱਤਰਾਂ, ਸਕੈਨ ਕੀਤੇ ਚਲਾਨਾਂ ਅਤੇ ਲਗਾਤਾਰ ਵਧ ਰਹੇ ਵੀਡੀਓ ਫੁਟੇਜ ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿਆਂ ਉੱਤੇ ਚੱਲਦਾ ਹੈ.
ਏਮਬੈਡ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ OCR ਜਾਂ ਦ੍ਰਿਸ਼ਟੀ LLM ਰਾਹੀਂ ਚਿੱਤਰ ਦਾ ਟੈਕਸਟ ਵਿੱਚ “ਵਰਣਨ” ਕਰਨਾ ਇਸ ਨੂੰ ਸੰਭਾਲਣ ਦਾ ਉਦਯੋਗਿਕ ਮਿਆਰ ਹੈ, ਪਰ ਇਹ ਇੱਕ ਵੱਡੀ ਰੁਕਾਵਟ ਹੈ. ਇਹ ਹੌਲੀ ਅਤੇ ਮਹਿੰਗਾ ਹੈ ਅਤੇ ਮੂਲ ਡਾਟੇ ਦਾ ਭਰਪੂਰ ਸਥਾਨਕ ਤੇ ਦ੍ਰਿਸ਼ਟਮਾਨ ਸੰਦਰਭ ਲਾਜ਼ਮੀ ਤੌਰ ਉੱਤੇ ਗੁਆ ਦਿੰਦਾ ਹੈ. ਜੇ ਤੁਹਾਡੀ AI ਕਿਸੇ ਜਟਿਲ ਦ੍ਰਿਸ਼ ਨੂੰ ਸਿਰਫ਼ “ਇੱਕ ਨਕਸ਼ਾ” ਕਹਿੰਦੀ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਉਸ ਵਿੱਚ ਮੌਜੂਦ ਖ਼ਾਸ ਵਾਲਵ ਜਾਂ ਤਾਰਬੰਦੀ ਰੂਪ-ਰੇਖਾ ਖੋਜਣ ਦੀ ਸਮਰੱਥਾ ਗੁਆ ਦਿੱਤੀ ਹੈ.
ਅੱਜ ਅਸੀਂ ColPali ਢਾਂਚੇ ਉੱਤੇ ਆਧਾਰਿਤ ਅਤਿ-ਆਧੁਨਿਕ ਬਹੁ-ਮਾਧਿਅਮ ਏਮਬੈਡਿੰਗ ਮਾਡਲਾਂ ਦਾ ਪਰਿਵਾਰ ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਜੋ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਦ੍ਰਿਸ਼ਟਮਾਨ ਪ੍ਰਾਪਤੀ ਸੰਭਵ ਬਣਾ ਕੇ ਇਸ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ.
ਸੱਚਮੁੱਚ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਹੁ-ਮਾਧਿਅਮ ਪ੍ਰਾਪਤੀਕਰਤਾ ਬਣਾਉਣਾ ਇੰਨਾ ਸੌਖਾ ਨਹੀਂ ਕਿ ਤਿਆਰ ਦ੍ਰਿਸ਼ਟੀ-ਭਾਸ਼ਾ ਮਾਡਲ (VLM) ਲੈ ਕੇ ਉਸ ਨੂੰ ਖੋਜਣ ਲਈ ਕਹਿ ਦਿੱਤਾ ਜਾਵੇ. ਬਹੁ-ਮਾਧਿਅਮ RAG ਨੂੰ ਲੰਮੇ ਸਮੇਂ ਤੋਂ ਰੋਕ ਰਹੀਆਂ ਚੁਣੌਤੀਆਂ ਹੱਲ ਕਰਨ ਅਤੇ ColQwen3 ਬਣਾਉਣ ਲਈ ਅਸੀਂ ਮਾਡਲ ਵਿਲੀਨ ਅਤੇ ਸਿਖਲਾਈ ਰਣਨੀਤੀਆਂ ਵਰਤੀਆਂ.
ਆਧਾਰ ਮਾਡਲ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਸੁਖਮ-ਅਨੁਕੂਲਿਤ ਕਰਨ ਦੀ ਬਜਾਏ ਅਸੀਂ ਮੌਜੂਦਾ ਲਿਖਤੀ ਏਮਬੈਡਿੰਗ ਮਾਡਲ ਤੋਂ ਪ੍ਰਾਪਤੀ ਕਾਰਜਾਂ ਦਾ ਗਿਆਨ ਤਬਦੀਲ ਕਰਨ ਦਾ ਤਰੀਕਾ ਬਣਾਇਆ. ਮਿਆਰੀ VLM ਚਿੱਤਰਾਂ ਦਾ ਵਰਣਨ ਕਰਨਾ ਜਾਣਦਾ ਹੈ, ਪਰ ਲਾਜ਼ਮੀ ਨਹੀਂ ਕਿ ਉਹ ਪੁੱਛਗਿੱਛ ਦੇ ਮੁਕਾਬਲੇ ਅਰਥਾਂ ਅਨੁਸਾਰ ਉਨ੍ਹਾਂ ਨੂੰ ਦਰਜਾ ਦੇਣਾ ਵੀ ਜਾਣਦਾ ਹੋਵੇ.
ਇਸ ਅੰਤਰ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਅਸੀਂ ਅਨੁਕੂਲਿਤ ਵਿਲੀਨ ਭਾਰ ਰਣਨੀਤੀਆਂ ਵਰਤੀਆਂ. ਸਾਡੇ ਪ੍ਰਯੋਗਾਂ ਵਿੱਚ ਪਤਾ ਲੱਗਾ ਕਿ ਲਿਖਤੀ ਗੁਪਤ ਖੇਤਰ ਵਿੱਚ Qwen3-Embedding ਦੀ ਪ੍ਰਾਪਤੀ ਸਮਰੱਥਾ ਸਿੱਧੀ ਬਹੁ-ਮਾਧਿਅਮ ਖੇਤਰ ਵਿੱਚ ਤਬਦੀਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਅਤੇ ਤੁਰੰਤ ਸਿਖਲਾਈ ਤੋਂ ਬਿਨਾਂ ਵੀ ਚਿੱਤਰ ਤੇ ਵੀਡੀਓ ਪ੍ਰਾਪਤੀ ਲਈ ਸਧਾਰਨੀਕਰਨ ਕਰਦੀ ਹੈ. ਇਸ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸ਼ੁਰੂਆਤੀ ਸਥਾਪਨਾ ਨੂੰ ਮਜ਼ਬੂਤ ਆਧਾਰ ਬਣਾਉਂਦਿਆਂ ਅਸੀਂ ਕਾਰਗੁਜ਼ਾਰੀ ਹੋਰ ਬਿਹਤਰ ਕਰਨ ਅਤੇ ਮਜ਼ਬੂਤੀ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਮਾਡਲ ਨੂੰ ਸੁਖਮ-ਅਨੁਕੂਲਿਤ ਕੀਤਾ. ਇਹ Qwen3-VL ਆਧਾਰ ਮਾਡਲ ਤੋਂ ਸੁਖਮ-ਅਨੁਕੂਲਨ ਦੇ ਮੁਕਾਬਲੇ ਅੰਤਿਮ ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਸੁਧਾਰਦਾ ਹੈ.
ਏਮਬੈਡਿੰਗ ਸਮਰੱਥਾਵਾਂ ਤਬਦੀਲ ਹੋਣ ਮਗਰੋਂ ਅਸੀਂ ਇਕਸਾਰਤਾ ਉੱਤੇ ਧਿਆਨ ਦਿੱਤਾ. ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵੱਧ ਤੋਂ ਵੱਧ ਕਰਨ ਲਈ ਅਸੀਂ ਹਾਈਪਰ-ਪੈਰਾਮੀਟਰ ਖੋਜਾਂ ਅਤੇ ਘਟਕ-ਹਟਾਓ ਅਧਿਐਨ ਧਿਆਨ ਨਾਲ ਕੀਤੇ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਸਰਵੋਤਮ ਯੁੱਗਾਂ ਦੀ ਗਿਣਤੀ, ਬੈਚ ਆਕਾਰ, ਸਿੱਖਣ ਦਰ, LoRA ਰੈਂਕ ਅਤੇ ਡਾਟਾਸੈੱਟਾਂ ਦਾ ਮਿਸ਼ਰਣ ਸ਼ਾਮਲ ਸਨ.
ਸੁਖਮ-ਅਨੁਕੂਲਨ ਡਾਟਾਸੈੱਟਾਂ ਵਜੋਂ ਅਸੀਂ VDR, ColPali ਸਿਖਲਾਈ ਸੈੱਟ, visrag_syn, ਅਤੇ visrag_ind ਚੁਣੇ. ਅਸੀਂ ਸੁਖਮ-ਅਨੁਕੂਲਨ ਲਈ UniMax ਨਮੂਨਾਕਰਨ ਵਰਤਿਆ. ਕਿਉਂਕਿ ਅਸੀਂ ਮਾਡਲ ਵਿਲੀਨ ਲਾਗੂ ਕੀਤਾ ਸੀ ਅਤੇ ਆਧਾਰ ਵਿਲੀਨ ਮਾਡਲ ਨੂੰ ਪਹਿਲਾਂ ਹੀ ਕੁਝ ਬਹੁ-ਮਾਧਿਅਮ ਪ੍ਰਾਪਤੀ ਸਮਰੱਥਾ ਵਿਰਾਸਤ ਵਿੱਚ ਮਿਲੀ ਸੀ, ਅਸੀਂ ਵੇਖਿਆ ਕਿ ਹੋਰ ਡਾਟਾਸੈੱਟ ਜੋੜਨ ਨਾਲ ਕਾਰਗੁਜ਼ਾਰੀ ਥੋੜ੍ਹੀ ਘਟਦੀ ਹੈ. ਇਸ ਲਈ ਅਸੀਂ ਹੋਰ ਡਾਟਾਸੈੱਟ ਨਹੀਂ ਜੋੜੇ.
ਸੁਖਮ-ਅਨੁਕੂਲਨ ਲਈ ਸਾਡੇ ਚੁਣੇ ਹਾਈਪਰ-ਪੈਰਾਮੀਟਰ ਇਹ ਹਨ:
LoRA ਰੈਂਕ | 32 |
LoRA ਐਲਫ਼ਾ | 32 |
LoRA ਟੀਚਾ ਮੋਡੀਊਲ | ਏਮਬੈਡਿੰਗ ਤੋਂ ਇਲਾਵਾ ਚਿੱਤਰ ਅਤੇ ਟੈਕਸਟ ਦੋਵਾਂ ਦੀਆਂ ਸਾਰੀਆਂ ਪਰਤਾਂ |
ਸਿੱਖਣ ਦਰ | 5e-5 |
ਵੱਧ ਤੋਂ ਵੱਧ ਦ੍ਰਿਸ਼ਟਮਾਨ ਟੋਕਨ | 1280 |
ਸਿਖਲਾਈ ਯੁੱਗ | 1 |
ਸਮੁੱਚਾ ਬੈਚ ਆਕਾਰ | 512 |
ਸ਼ੁਰੂਆਤੀ ਗਰਮਾਹਟ ਅਨੁਪਾਤ | 5% |
ਇਤਿਹਾਸਕ ਤੌਰ ਉੱਤੇ “ColBERT-ਸ਼ੈਲੀ” ਦੀਆਂ ਟੋਕਨ-ਪੱਧਰੀ ਏਮਬੈਡਿੰਗਾਂ ਵਰਤਣ ਵਾਲੇ ਮਾਡਲਾਂ, ਜਿਵੇਂ ColPali, ਨੇ ਸ਼ਾਨਦਾਰ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੱਤੀ ਪਰ ਸਟੋਰੇਜ ਲਾਗਤ ਬੇਹੱਦ ਉੱਚੀ ਸੀ. ਹਰ ਦ੍ਰਿਸ਼ਟਮਾਨ ਟੋਕਨ ਨੂੰ ਸੂਚੀਬੱਧ ਕਰਨ ਨਾਲ ਵਿਸ਼ਾਲ ਵੈਕਟਰ ਡਾਟਾਬੇਸ ਬਣੇ, ਜੋ ਉੱਦਮੀ ਪੱਧਰ ਲਈ ਬਹੁਤ ਮਹਿੰਗੇ ਸਨ.
ਅਨੁਕੂਲਨ ਰਣਨੀਤੀ: ਅਸੀਂ ਆਪਣੀਆਂ ਏਮਬੈਡਿੰਗਾਂ ਦੇ ਆਕਾਰ ਨੂੰ ਧਿਆਨ ਨਾਲ ਸੰਤੁਲਿਤ ਕਰਕੇ ਸਟੋਰੇਜ ਦੀ ਚੁਣੌਤੀ ਹੱਲ ਕੀਤੀ, ਤਾਂ ਜੋ ਵੱਧ ਤੋਂ ਵੱਧ ਕਾਰਗੁਜ਼ਾਰੀ ਬਰਕਰਾਰ ਰਹੇ ਅਤੇ ਸਟੋਰੇਜ ਲਾਗਤ ਬੇਕਾਬੂ ਨਾ ਹੋਵੇ. ਇਸ ਕੁਸ਼ਲ ਆਕਾਰ ਵਿੱਚ SOTA ਸ਼ੁੱਧਤਾ ਕਾਇਮ ਰੱਖਣ ਲਈ ਅਸੀਂ ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਅਤੇ ਸਟੋਰੇਜ ਲਾਗਤ ਦਾ ਸਭ ਤੋਂ ਸੰਤੁਲਿਤ ਮੇਲ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਸਤੇ ਅਯਾਮ ਆਕਾਰ 320 ਚੁਣਿਆ.
ਆਧਾਰ: ਮਿਆਰੀ ਪਹੁੰਚ, ਜਿਵੇਂ NVIDIA Nemo-3B, ਨੂੰ 10 ਲੱਖ ਚਿੱਤਰਾਂ ਦੀਆਂ ਏਮਬੈਡਿੰਗਾਂ ਸਟੋਰ ਕਰਨ ਲਈ ਲਗਭਗ 10.3 TB ਚਾਹੀਦਾ ਹੈ (1,802 ਟੋਕਨ @ 3,072 ਅਯਾਮ).
ColQwen3: ਉਹੀ 10 ਲੱਖ ਚਿੱਤਰ ਸਿਰਫ਼ 0.82 TB ਵਿੱਚ ਸਟੋਰ ਕਰਦਾ ਹੈ (ਵੱਧ ਤੋਂ ਵੱਧ 1,280 ਟੋਕਨ @ 320 ਅਯਾਮ).
ColQwen3 ਕਲਾਉਡ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦਾ ਬਜਟ ਬੇਕਾਬੂ ਕੀਤੇ ਬਿਨਾਂ SOTA ਪ੍ਰਾਪਤੀ ਸ਼ੁੱਧਤਾ ਹਾਸਲ ਕਰਦਾ ਹੈ.
ਅਸੀਂ ViDoRe ਬੈਂਚਮਾਰਕ ਸੂਟ ਉੱਤੇ ਆਪਣੀ ਪਹੁੰਚ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ. ਨਤੀਜੇ ਪੁਸ਼ਟੀ ਕਰਦੇ ਹਨ ਕਿ ColQwen3 ਨਵੀਨਤਮ V3 ਅਤੇ V2 ਬੈਂਚਮਾਰਕਾਂ, ਅੰਗਰੇਜ਼ੀ ਤੇ ਬਹੁਭਾਸ਼ਾਈ ਦੋਵਾਂ, ਉੱਤੇ ਨਵੇਂ ਮਿਆਰ ਕਾਇਮ ਕਰਦਾ ਹੈ ਅਤੇ ਪੁਰਾਣੇ V1 ਕਾਰਜਾਂ ਉੱਤੇ ਵੀ ਸਿਖਰਲੇ ਪੱਧਰ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ.
ColQwen3-8B ਅੰਗਰੇਜ਼ੀ ਅਤੇ ਬਹੁਭਾਸ਼ਾਈ ਪ੍ਰਾਪਤੀ ਵਿੱਚ ਸਭ ਤੋਂ ਅੱਗੇ ਹੈ.
ਅੰਗਰੇਜ਼ੀ nDCG@5
ਮਾਡਲ | ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ | ਊਰਜਾ | ਵਿੱਤ | ਮਨੁੱਖੀ ਸਰੋਤ | ਉਦਯੋਗ | ਦਵਾਈ ਉਦਯੋਗ | ਭੌਤਿਕ ਵਿਗਿਆਨ | ਔਸਤ |
0.7443 | 0.6491 | 0.6823 | 0.6421 | 0.5766 | 0.6665 | 0.4747 | 0.6113 | |
0.7419 | 0.6023 | 0.6753 | 0.6037 | 0.5787 | 0.6612 | 0.4640 | 0.5934 | |
0.7514 | 0.5838 | 0.6712 | 0.6256 | 0.5447 | 0.6524 | 0.4128 | 0.5769 | |
0.7175 | 0.5842 | 0.6417 | 0.6206 | 0.5443 | 0.6303 | 0.4191 | 0.5680 |
ਬਹੁਭਾਸ਼ਾਈ nDCG@5
ਮਾਡਲ | ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ | ਊਰਜਾ | ਵਿੱਤ | ਮਨੁੱਖੀ ਸਰੋਤ | ਉਦਯੋਗ | ਦਵਾਈ ਉਦਯੋਗ | ਭੌਤਿਕ ਵਿਗਿਆਨ | ਔਸਤ |
0.7194 | 0.6619 | 0.6172 | 0.6097 | 0.5164 | 0.6403 | 0.4706 | 0.5866 | |
0.7213 | 0.6374 | 0.6019 | 0.5637 | 0.5131 | 0.6351 | 0.4636 | 0.5708 | |
0.7216 | 0.5901 | 0.5646 | 0.5504 | 0.4335 | 0.6170 | 0.4192 | 0.5383 |
ESG, ਅਰਥਸ਼ਾਸਤਰ ਅਤੇ DocVQA ਵਿੱਚ ਲਗਾਤਾਰ ਉੱਚ ਕਾਰਗੁਜ਼ਾਰੀ.
ਬੈਂਚਮਾਰਕ | ਮਾਡਲ | ਸਕੋਰ (ਔਸਤ) | ਜ਼ਿਕਰਯੋਗ ਜਿੱਤ |
ViDoRe V2 (ਅੰਗਰੇਜ਼ੀ) | ColQwen3-8B | 0.6772 | ESG ਅਤੇ BioMed ਵਿੱਚ #1 |
ViDoRe V2 (ਬਹੁਭਾਸ਼ਾਈ) | ColQwen3-8B | 0.6085 | ਅਰਥਸ਼ਾਸਤਰ ਵਿੱਚ #1 |
ViDoRe V1 (ਅੰਗਰੇਜ਼ੀ) | Nemo ColEmbed 3B | 0.9100 | ਥੋੜ੍ਹੀ ਵੱਧ ਔਸਤ |
ViDoRe V1 (ਅੰਗਰੇਜ਼ੀ) | ColQwen3-8B | 0.9076 | ArxivQA ਅਤੇ Syn-Gov ਵਿੱਚ #1 |
ਇਹ ਦਿਖਾਉਣ ਲਈ ਕਿ ColQwen3 ਵੀਡੀਓ ਪ੍ਰਾਪਤੀ ਲਈ ਵੀ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਸਧਾਰਨੀਕਰਨ ਕਰਦਾ ਹੈ, ਅਸੀਂ ਟੈਕਸਟ-ਤੋਂ-ਵੀਡੀਓ (ਆਮ ਪ੍ਰਾਪਤੀ) ਕਾਰਜਾਂ ਲਈ CareBench ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਮਾਡਲਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ.
ਇਸ ਮੁਲਾਂਕਣ ਲਈ ਅਸੀਂ ਕੱਚੀ ਵੀਡੀਓ ਏਨਕੋਡਿੰਗ ਪਹੁੰਚ ਵਰਤੀ: ਸਾਡੇ ਮਾਡਲਾਂ ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਲਿਖਤੀ ਟਿੱਪਣੀ ਜਾਂ ਮੈਟਾਡੇਟਾ ਇਨਪੁੱਟ ਦੇ ਵੀਡੀਓ ਫ਼ਾਈਲਾਂ ਨੂੰ ਸਿੱਧਾ ਏਨਕੋਡ ਕੀਤਾ. ਇਹ ਸਿਰਫ਼ ਦ੍ਰਿਸ਼ਟਮਾਨ ਅਰਥਾਂ ਦੇ ਆਧਾਰ ਉੱਤੇ ਪ੍ਰਾਪਤੀ ਕਰਨ ਦੀ ਮਾਡਲ ਦੀ ਸਮਰੱਥਾ ਦਰਸਾਉਂਦਾ ਹੈ.
ਮਾਡਲ | ਰੀਕਾਲ@1 | ਰੀਕਾਲ@5 | ਰੀਕਾਲ@10 |
0.8670 | 0.9590 | 0.9850 | |
0.8620 | 0.9570 | 0.9800 | |
0.7700 | 0.9560 | 0.9870 |
ColQwen3 ਨਾਲ ਆਏ ਸਭ ਤੋਂ ਵੱਡੇ ਬਦਲਾਵਾਂ ਵਿੱਚੋਂ ਇੱਕ ਹੈ ਵੀਡੀਓ ਨੂੰ ਦਸਤਾਵੇਜ਼ਾਂ ਵਾਂਗ ਵਰਤਣ ਦੀ ਸਮਰੱਥਾ. ਬਹੁਤ ਸਾਰੇ ਉੱਦਮਾਂ ਵਿੱਚ ਵੀਡੀਓ “ਅਣਵਰਤਿਆ ਡਾਟਾ” ਹੈ. ਇਹ ਠੰਢੀ ਸਟੋਰੇਜ ਵਿੱਚ ਪਿਆ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਉਦੋਂ ਤੱਕ ਖੋਜਿਆ ਨਹੀਂ ਜਾ ਸਕਦਾ ਜਦੋਂ ਤੱਕ ਕਿਸੇ ਮਨੁੱਖ ਨੇ ਹਰ ਫ਼ਾਈਲ ਨੂੰ ਹੱਥੀਂ ਟੈਗ ਨਾ ਕੀਤਾ ਹੋਵੇ.
ColQwen3 ਖੰਡਿਤ ਕਲਿੱਪਾਂ ਵਿੱਚ ਫਰੇਮ-ਵਾਰ ਪ੍ਰਾਪਤੀ ਸੰਭਵ ਬਣਾ ਕੇ ਇਸ ਨੂੰ ਬਦਲਦਾ ਹੈ.
ਉੱਦਮ ਹਰ ਰੋਜ਼ ਹਜ਼ਾਰਾਂ ਘੰਟਿਆਂ ਦੀਆਂ ਅੰਦਰੂਨੀ ਵੀਡੀਓ ਮੀਟਿੰਗਾਂ ਰਿਕਾਰਡ ਕਰਦੇ ਹਨ ਅਤੇ ਆਮ ਤੌਰ ਉੱਤੇ ਇਹ ਰਿਕਾਰਡਿੰਗਾਂ ਗੁੰਮਨਾਮ ਭੰਡਾਰ ਵਿੱਚ ਗੁਆਚ ਜਾਂਦੀਆਂ ਹਨ.
ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਮੀਟਿੰਗਾਂ ਦੀਆਂ ਲੰਮੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਆਪਣੇ-ਆਪ ਛੋਟੀਆਂ, ਤਰਕਸੰਗਤ ਕਲਿੱਪਾਂ ਵਿੱਚ ਵੰਡ ਕੇ ਅਤੇ ColQwen3 ਨਾਲ ਸੂਚੀਬੱਧ ਕਰਕੇ ਤੁਸੀਂ ਖੋਜਯੋਗ “ਸੰਗਠਨਾਤਮਕ ਯਾਦ” ਬਣਾਉਂਦੇ ਹੋ.
ਪੁੱਛਗਿੱਛ: ਕੋਈ ਪ੍ਰੋਜੈਕਟ ਪ੍ਰਬੰਧਕ ਪੁੱਛ ਸਕਦਾ ਹੈ: “ਮੈਨੂੰ ਉਹ ਕਲਿੱਪ ਦਿਖਾਓ ਜਿਸ ਵਿੱਚ ਇੰਜੀਨੀਅਰਿੰਗ ਮੁਖੀ ਨੇ API ਨਾਲ ਜੁੜੀ ਦੇਰੀ ਦੀ ਸਮੱਸਿਆ ਸਮਝਾਈ ਸੀ.”
ਨਤੀਜਾ: 60 ਮਿੰਟ ਦੀ ਵੀਡੀਓ ਫ਼ਾਈਲ ਦੇਣ ਦੀ ਬਜਾਏ ਸਿਸਟਮ ਠੀਕ ਉਹੀ 45 ਸਕਿੰਟ ਦਾ ਭਾਗ ਲੱਭਦਾ ਹੈ ਜਿਸ ਵਿੱਚ ਖ਼ਾਸ ਚਿੱਤਰ ਸਕ੍ਰੀਨ ਉੱਤੇ ਸਾਂਝਾ ਕਰਕੇ ਵਿਚਾਰਿਆ ਗਿਆ ਸੀ, ਭਾਵੇਂ ਬੋਲਣ ਵਾਲਿਆਂ ਨੇ ਉਸੇ ਪਲ “ਦੇਰੀ” ਸ਼ਬਦ ਸਪਸ਼ਟ ਤੌਰ ਉੱਤੇ ਨਾ ਕਿਹਾ ਹੋਵੇ.
ਮੂਲ ਬਹੁ-ਮਾਧਿਅਮ ਏਮਬੈਡਿੰਗ ਵੱਲ ਬਦਲਾਅ ਉਦਯੋਗਾਂ ਵਿੱਚ ਬਿਲਕੁਲ ਨਵੇਂ ਕਾਰਜ-ਪ੍ਰਵਾਹ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ. ਅਸੀਂ ਸਭ ਤੋਂ ਜਟਿਲ ਉੱਦਮੀ ਡਾਟਾ ਮਾਹੌਲਾਂ ਵਿੱਚੋਂ ਕੁਝ ਦੇ ਮੁਕਾਬਲੇ ਇਸ ਮਾਡਲ ਦੀ ਵਿਆਪਕ ਬੈਂਚਮਾਰਕ ਜਾਂਚ ਕੀਤੀ ਹੈ.
ਅਸੀਂ ColQwen3 ਨੂੰ ਸ਼ਹਿਰੀ ਸਲਾਹਕਾਰੀ ਕੰਪਨੀਆਂ ਦੀਆਂ ਡਾਟਾ ਚੁਣੌਤੀਆਂ ਉੱਤੇ ਪਰਖਿਆ, ਜੋ ਮਾਸਟਰ ਪਲਾਨਾਂ, ਜ਼ੋਨਿੰਗ ਨਕਸ਼ਿਆਂ ਅਤੇ ਜਟਿਲ ਵਾਸਤੂਕਲਾ ਉਚਾਈ-ਚਿੱਤਰਾਂ ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿ ਸੰਭਾਲਦੀਆਂ ਹਨ.
ਚੁਣੌਤੀ: ਇਨ੍ਹਾਂ ਮਾਹੌਲਾਂ ਵਿੱਚ ਰਵਾਇਤੀ RAG ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਮੁਸ਼ਕਲ ਆਉਂਦੀ ਹੈ. OCR ਸਾਧਨ ਆਮ ਤੌਰ ਉੱਤੇ ਜਟਿਲ ਸਾਈਟ ਯੋਜਨਾਵਾਂ ਨੂੰ ਸਿਰਫ਼ “ਰੂਪ-ਰੇਖਾ” ਕਹਿੰਦੇ ਹਨ ਅਤੇ ਆਵਾਜਾਈ ਦੇ ਵਹਾਅ, ਹਰੇ ਖੇਤਰਾਂ ਜਾਂ ਇਮਾਰਤਾਂ ਦੀ ਪਿੱਛੇ ਹਟਾਈ ਦੂਰੀ ਵਰਗੇ ਅਹਿਮ ਵੇਰਵੇ ਗੁਆ ਦਿੰਦੇ ਹਨ.
ਕਾਰਗੁਜ਼ਾਰੀ: ਸਾਡੇ ਅੰਦਰੂਨੀ ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ColQwen3 ਮਹਿੰਗੀ OCR/ਸਿਰਲੇਖਕਰਨ ਪੂਰਵ-ਪ੍ਰਕਿਰਿਆ ਦੀ ਲੋੜ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਟਾਲ ਦਿੰਦਾ ਹੈ. ਸੰਘਣੇ ਵਾਸਤੂਕਲਾ ਚਿੱਤਰਾਂ ਵਾਲੇ ਟੈਸਟਾਂ ਵਿੱਚ ਮਾਡਲ ਨੇ ਪੈਦਲ ਪਹੁੰਚ ਬਿੰਦੂਆਂ ਜਾਂ ਵੱਖਰੀਆਂ ਜ਼ੋਨਿੰਗ ਹੱਦਾਂ ਵਰਗੇ ਖ਼ਾਸ ਦ੍ਰਿਸ਼ਟਮਾਨ ਚਿੰਨ੍ਹਾਂ ਦੇ ਆਧਾਰ ਉੱਤੇ ਦਸਤਾਵੇਜ਼ ਸਫਲਤਾਪੂਰਵਕ ਲੱਭੇ. ਇਸ ਨੇ ਸਿਰਫ਼ ਟੈਕਸਟ ਵਾਲੇ ਆਧਾਰਾਂ ਨਾਲੋਂ ਕਾਫ਼ੀ ਬਿਹਤਰ ਨਤੀਜੇ ਦਿੱਤੇ ਅਤੇ ਗਿਆਨ ਗ੍ਰਹਿਣ ਦੀ ਲਾਗਤ ਵਿੱਚ ਵੱਡੀ ਕਮੀ ਦੀ ਸੰਭਾਵਨਾ ਦਿਖਾਈ.
ਨਿਵੇਸ਼ ਬੈਂਕਰ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਕ ਸਾਲਾਨਾ ਰਿਪੋਰਟਾਂ ਤੇ ਨਿਵੇਸ਼ਕ ਪੇਸ਼ਕਾਰੀਆਂ ਖੰਗਾਲਣ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਘੰਟੇ ਲਾਉਂਦੇ ਹਨ.
ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਵਿਸ਼ਲੇਸ਼ਕ ਪੁੱਛ ਸਕਦਾ ਹੈ, “2024 ਦੀਆਂ ਸਲਾਈਡ ਪੇਸ਼ਕਾਰੀਆਂ ਵਿੱਚੋਂ APAC ਅਤੇ EMEA ਆਮਦਨ ਦਾ ਵੇਰਵਾ ਲੱਭੋ.”
ਬਦਲਾਅ: ਮੁੱਖ ਸ਼ਬਦਾਂ ਦੇ ਮੇਲ ਉੱਤੇ ਨਿਰਭਰ ਰਹਿਣ ਦੀ ਬਜਾਏ ਮਾਡਲ ਖ਼ਾਸ ਡਾਟਾ-ਦ੍ਰਿਸ਼ਟੀਕਰਨ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਮੌਜੂਦਗੀ ਦੇ ਆਧਾਰ ਉੱਤੇ ਸਹੀ ਸਲਾਈਡ ਲੱਭਦਾ ਹੈ, ਜਿਸ ਨਾਲ RAG ਸਿਸਟਮ ਬਹੁਤ ਸਟੀਕ ਜਵਾਬ ਦੇ ਸਕਦਾ ਹੈ.
ਨਿਰਮਾਣ ਕੰਪਨੀਆਂ ਕੋਲ ਤਕਨੀਕੀ ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ ਪਾਈਪਿੰਗ ਚਿੱਤਰਾਂ (P&IDs) ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿ ਹੁੰਦੇ ਹਨ.
ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਟਰਬਾਈਨ ਠੀਕ ਕਰ ਰਿਹਾ ਖੇਤਰੀ ਇੰਜੀਨੀਅਰ ਕਿਸੇ ਪੁਰਜ਼ੇ ਦੀ ਫ਼ੋਟੋ ਲੈ ਸਕਦਾ ਹੈ ਜਾਂ ਪੁੱਛ ਸਕਦਾ ਹੈ, “ਮੈਨੂੰ ਹਾਈਡ੍ਰੌਲਿਕ ਪੰਪ ਅਸੈਂਬਲੀ ਦਾ ਤਾਰਬੰਦੀ ਚਿੱਤਰ ਦਿਖਾਓ.”
ਬਦਲਾਅ: ColQwen3 ਤਾਰਬੰਦੀ ਚਿੱਤਰ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਪੇਸ਼ਕਾਰੀ ਪਛਾਣ ਕੇ ਸਹੀ ਸਫ਼ਾ ਲੱਭਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਬੰਦ ਰਹਿਣ ਦਾ ਸਮਾਂ ਕਈ ਘੰਟੇ ਘਟ ਸਕਦਾ ਹੈ.
ਕਾਨੂੰਨੀ ਖੋਜ ਵਿੱਚ ਲੱਖਾਂ ਸਕੈਨ ਕੀਤੇ ਸਫ਼ਿਆਂ ਦੀ ਸਮੀਖਿਆ ਹੁੰਦੀ ਹੈ, ਜਿੱਥੇ ਲੱਭੀ ਜਾਣ ਵਾਲੀ ਅਹਿਮ ਚੀਜ਼ ਅਕਸਰ ਕੋਈ ਦ੍ਰਿਸ਼ਟਮਾਨ ਚਿੰਨ੍ਹ ਹੁੰਦੀ ਹੈ.
ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਪਾਲਣਾ ਅਧਿਕਾਰੀ “CFO ਵੱਲੋਂ ਦਸਤਖ਼ਤ ਕੀਤੇ ਦਸਤਾਵੇਜ਼” ਜਾਂ “ਅਧਿਕਾਰਤ ‘ਗੁਪਤ’ ਮੋਹਰ ਵਾਲੇ ਇਕਰਾਰਨਾਮੇ” ਖੋਜ ਸਕਦਾ ਹੈ.
ਬਦਲਾਅ: ਮਾਡਲ ਦਸਤਖ਼ਤਾਂ ਜਾਂ ਮੋਹਰਾਂ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਮੌਜੂਦਗੀ ਦੇ ਆਧਾਰ ਉੱਤੇ ਖਰੜੇ ਅਤੇ ਅੰਤਿਮ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਫ਼ਰਕ ਕਰਦਾ ਹੈ, ਜੋ ਸਿਰਫ਼ OCR ਅਕਸਰ ਨਹੀਂ ਪਛਾਣਦਾ.
ColQwen3 ਖੁੱਲ੍ਹੇ ਭਾਰਾਂ ਵਾਲਾ (Apache 2.0) ਹੈ ਅਤੇ ਹੁਣ Hugging Face ਉੱਤੇ ਉਪਲਬਧ ਹੈ. ਅਸੀਂ ਇਸ ਨੂੰ ਆਧੁਨਿਕ RAG ਪਾਈਪਲਾਈਨਾਂ ਲਈ ਸਿੱਧੇ ਬਦਲ ਵਜੋਂ ਤਿਆਰ ਕੀਤਾ ਹੈ ਅਤੇ ਟੈਕਸਟ, ਚਿੱਤਰ ਤੇ ਵੀਡੀਓ ਤੁਰੰਤ ਪ੍ਰਕਿਰਿਆ ਕਰਨ ਲਈ ਲੋੜੀਂਦਾ ਅਨੁਮਾਨ ਕੋਡ ਦਿੱਤਾ ਹੈ.
ਸਾਦੀ ਟੈਕਸਟ ਖੋਜ ਤੋਂ ਅੱਗੇ ਵਧ ਕੇ ਆਪਣੀਆਂ ਦ੍ਰਿਸ਼ਟਮਾਨ ਸੰਪਤੀਆਂ ਵਿੱਚ ਬੰਦ ਇੰਟੈਲੀਜੈਂਸ ਨੂੰ ਵਰਤਣ ਲਈ ਤਿਆਰ ਉੱਦਮਾਂ ਵਾਸਤੇ ਇਹ ਨਵਾਂ ਮਿਆਰ ਹੈ.
ਅਗਲਾ ਕਦਮ: ਮਾਡਲ ਕਾਰਡ ਵੇਖੋ ਅਤੇ Hugging Face ਉੱਤੇ ਸਿੱਧਾ ਪ੍ਰਦਰਸ਼ਨ ਅਜ਼ਮਾਓ: /-colqwen3-embed-8b ਅਤੇ /-colqwen3-embed-4b