ਮੁੱਖ ਨੇਵੀਗੇਸ਼ਨ

ਟੈਕਸਟ ਤੋਂ ਅੱਗੇ: ਅਸਲ ਬਹੁ-ਮਾਧਿਅਮ, ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ RAG ਨੂੰ ਸਮਰੱਥ ਬਣਾਉਣਾ

ਬਹੁ-ਮਾਧਿਅਮ ਏਮਬੈਡਿੰਗ ਮਾਡਲ ਟੀਮਾਂ ਨੂੰ ਜਟਿਲ ਦਸਤਾਵੇਜ਼ਾਂ, ਚਿੱਤਰਾਂ ਅਤੇ ਵੀਡੀਓ ਤੋਂ ਲਾਭਦਾਇਕ ਜਾਣਕਾਰੀ ਸਿੱਧੀ ਪ੍ਰਾਪਤ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕਰਦੇ ਹਨ.

ਪਿਛਲੇ ਦੋ ਸਾਲਾਂ ਤੋਂ “RAG” (ਪ੍ਰਾਪਤੀ-ਵਧਾਈ ਉਤਪੱਤੀ) ਲਗਭਗ ਪੂਰੀ ਤਰ੍ਹਾਂ ਟੈਕਸਟ ਦਾ ਸਮਾਨਾਰਥੀ ਰਿਹਾ ਹੈ. ਮਿਆਰੀ ਤਰੀਕਾ ਸੌਖਾ ਹੈ: ਦਸਤਾਵੇਜ਼ ਲਓ, ਟੈਕਸਟ ਕੱਢੋ, ਉਸ ਦੇ ਭਾਗ ਬਣਾਓ ਅਤੇ ਸੂਚੀਬੱਧ ਕਰੋ.

ਪਰ ਉੱਦਮੀ ਜਗਤ ਸਿਰਫ਼ ਸਾਦੀਆਂ ਟੈਕਸਟ ਫ਼ਾਈਲਾਂ ਉੱਤੇ ਨਹੀਂ ਚੱਲਦਾ. ਇਹ ਜਟਿਲ PDF, ਸੰਘਣੇ ਚਾਰਟਾਂ ਵਾਲੀਆਂ ਸਲਾਈਡ ਪੇਸ਼ਕਾਰੀਆਂ, CAD ਚਿੱਤਰਾਂ, ਸਕੈਨ ਕੀਤੇ ਚਲਾਨਾਂ ਅਤੇ ਲਗਾਤਾਰ ਵਧ ਰਹੇ ਵੀਡੀਓ ਫੁਟੇਜ ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿਆਂ ਉੱਤੇ ਚੱਲਦਾ ਹੈ.

ਏਮਬੈਡ ਕਰਨ ਤੋਂ ਪਹਿਲਾਂ OCR ਜਾਂ ਦ੍ਰਿਸ਼ਟੀ LLM ਰਾਹੀਂ ਚਿੱਤਰ ਦਾ ਟੈਕਸਟ ਵਿੱਚ “ਵਰਣਨ” ਕਰਨਾ ਇਸ ਨੂੰ ਸੰਭਾਲਣ ਦਾ ਉਦਯੋਗਿਕ ਮਿਆਰ ਹੈ, ਪਰ ਇਹ ਇੱਕ ਵੱਡੀ ਰੁਕਾਵਟ ਹੈ. ਇਹ ਹੌਲੀ ਅਤੇ ਮਹਿੰਗਾ ਹੈ ਅਤੇ ਮੂਲ ਡਾਟੇ ਦਾ ਭਰਪੂਰ ਸਥਾਨਕ ਤੇ ਦ੍ਰਿਸ਼ਟਮਾਨ ਸੰਦਰਭ ਲਾਜ਼ਮੀ ਤੌਰ ਉੱਤੇ ਗੁਆ ਦਿੰਦਾ ਹੈ. ਜੇ ਤੁਹਾਡੀ AI ਕਿਸੇ ਜਟਿਲ ਦ੍ਰਿਸ਼ ਨੂੰ ਸਿਰਫ਼ “ਇੱਕ ਨਕਸ਼ਾ” ਕਹਿੰਦੀ ਹੈ, ਤਾਂ ਤੁਸੀਂ ਉਸ ਵਿੱਚ ਮੌਜੂਦ ਖ਼ਾਸ ਵਾਲਵ ਜਾਂ ਤਾਰਬੰਦੀ ਰੂਪ-ਰੇਖਾ ਖੋਜਣ ਦੀ ਸਮਰੱਥਾ ਗੁਆ ਦਿੱਤੀ ਹੈ.

ਅੱਜ ਅਸੀਂ ColPali ਢਾਂਚੇ ਉੱਤੇ ਆਧਾਰਿਤ ਅਤਿ-ਆਧੁਨਿਕ ਬਹੁ-ਮਾਧਿਅਮ ਏਮਬੈਡਿੰਗ ਮਾਡਲਾਂ ਦਾ ਪਰਿਵਾਰ ਜਾਰੀ ਕਰ ਰਹੇ ਹਾਂ, ਜੋ ਸ਼ੁਰੂ ਤੋਂ ਅੰਤ ਤੱਕ ਦ੍ਰਿਸ਼ਟਮਾਨ ਪ੍ਰਾਪਤੀ ਸੰਭਵ ਬਣਾ ਕੇ ਇਸ ਸਮੱਸਿਆ ਨੂੰ ਹੱਲ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ.

ਕਮਾਲ ਪਿੱਛੇ ਦੀ ਇੰਜੀਨੀਅਰਿੰਗ: ਉੱਨਤ ਸੁਖਮ-ਅਨੁਕੂਲਨ ਰਣਨੀਤੀਆਂ

ਸੱਚਮੁੱਚ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਬਹੁ-ਮਾਧਿਅਮ ਪ੍ਰਾਪਤੀਕਰਤਾ ਬਣਾਉਣਾ ਇੰਨਾ ਸੌਖਾ ਨਹੀਂ ਕਿ ਤਿਆਰ ਦ੍ਰਿਸ਼ਟੀ-ਭਾਸ਼ਾ ਮਾਡਲ (VLM) ਲੈ ਕੇ ਉਸ ਨੂੰ ਖੋਜਣ ਲਈ ਕਹਿ ਦਿੱਤਾ ਜਾਵੇ. ਬਹੁ-ਮਾਧਿਅਮ RAG ਨੂੰ ਲੰਮੇ ਸਮੇਂ ਤੋਂ ਰੋਕ ਰਹੀਆਂ ਚੁਣੌਤੀਆਂ ਹੱਲ ਕਰਨ ਅਤੇ ColQwen3 ਬਣਾਉਣ ਲਈ ਅਸੀਂ ਮਾਡਲ ਵਿਲੀਨ ਅਤੇ ਸਿਖਲਾਈ ਰਣਨੀਤੀਆਂ ਵਰਤੀਆਂ.

1. ਅਨੁਕੂਲਿਤ ਵਿਲੀਨ ਭਾਰਾਂ ਰਾਹੀਂ ਏਮਬੈਡਿੰਗ ਸਮਰੱਥਾ ਦਾ ਤਬਾਦਲਾ

ਆਧਾਰ ਮਾਡਲ ਨੂੰ ਸ਼ੁਰੂ ਤੋਂ ਸੁਖਮ-ਅਨੁਕੂਲਿਤ ਕਰਨ ਦੀ ਬਜਾਏ ਅਸੀਂ ਮੌਜੂਦਾ ਲਿਖਤੀ ਏਮਬੈਡਿੰਗ ਮਾਡਲ ਤੋਂ ਪ੍ਰਾਪਤੀ ਕਾਰਜਾਂ ਦਾ ਗਿਆਨ ਤਬਦੀਲ ਕਰਨ ਦਾ ਤਰੀਕਾ ਬਣਾਇਆ. ਮਿਆਰੀ VLM ਚਿੱਤਰਾਂ ਦਾ ਵਰਣਨ ਕਰਨਾ ਜਾਣਦਾ ਹੈ, ਪਰ ਲਾਜ਼ਮੀ ਨਹੀਂ ਕਿ ਉਹ ਪੁੱਛਗਿੱਛ ਦੇ ਮੁਕਾਬਲੇ ਅਰਥਾਂ ਅਨੁਸਾਰ ਉਨ੍ਹਾਂ ਨੂੰ ਦਰਜਾ ਦੇਣਾ ਵੀ ਜਾਣਦਾ ਹੋਵੇ.

ਇਸ ਅੰਤਰ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਅਸੀਂ ਅਨੁਕੂਲਿਤ ਵਿਲੀਨ ਭਾਰ ਰਣਨੀਤੀਆਂ ਵਰਤੀਆਂ. ਸਾਡੇ ਪ੍ਰਯੋਗਾਂ ਵਿੱਚ ਪਤਾ ਲੱਗਾ ਕਿ ਲਿਖਤੀ ਗੁਪਤ ਖੇਤਰ ਵਿੱਚ Qwen3-Embedding ਦੀ ਪ੍ਰਾਪਤੀ ਸਮਰੱਥਾ ਸਿੱਧੀ ਬਹੁ-ਮਾਧਿਅਮ ਖੇਤਰ ਵਿੱਚ ਤਬਦੀਲ ਕੀਤੀ ਜਾ ਸਕਦੀ ਹੈ ਅਤੇ ਤੁਰੰਤ ਸਿਖਲਾਈ ਤੋਂ ਬਿਨਾਂ ਵੀ ਚਿੱਤਰ ਤੇ ਵੀਡੀਓ ਪ੍ਰਾਪਤੀ ਲਈ ਸਧਾਰਨੀਕਰਨ ਕਰਦੀ ਹੈ. ਇਸ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਸ਼ੁਰੂਆਤੀ ਸਥਾਪਨਾ ਨੂੰ ਮਜ਼ਬੂਤ ਆਧਾਰ ਬਣਾਉਂਦਿਆਂ ਅਸੀਂ ਕਾਰਗੁਜ਼ਾਰੀ ਹੋਰ ਬਿਹਤਰ ਕਰਨ ਅਤੇ ਮਜ਼ਬੂਤੀ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਮਾਡਲ ਨੂੰ ਸੁਖਮ-ਅਨੁਕੂਲਿਤ ਕੀਤਾ. ਇਹ Qwen3-VL ਆਧਾਰ ਮਾਡਲ ਤੋਂ ਸੁਖਮ-ਅਨੁਕੂਲਨ ਦੇ ਮੁਕਾਬਲੇ ਅੰਤਿਮ ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਸੁਧਾਰਦਾ ਹੈ.

2. ਹਾਈਪਰ-ਪੈਰਾਮੀਟਰਾਂ ਦਾ ਧਿਆਨਪੂਰਵਕ ਅਨੁਕੂਲਨ

ਏਮਬੈਡਿੰਗ ਸਮਰੱਥਾਵਾਂ ਤਬਦੀਲ ਹੋਣ ਮਗਰੋਂ ਅਸੀਂ ਇਕਸਾਰਤਾ ਉੱਤੇ ਧਿਆਨ ਦਿੱਤਾ. ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਵੱਧ ਤੋਂ ਵੱਧ ਕਰਨ ਲਈ ਅਸੀਂ ਹਾਈਪਰ-ਪੈਰਾਮੀਟਰ ਖੋਜਾਂ ਅਤੇ ਘਟਕ-ਹਟਾਓ ਅਧਿਐਨ ਧਿਆਨ ਨਾਲ ਕੀਤੇ, ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਸਰਵੋਤਮ ਯੁੱਗਾਂ ਦੀ ਗਿਣਤੀ, ਬੈਚ ਆਕਾਰ, ਸਿੱਖਣ ਦਰ, LoRA ਰੈਂਕ ਅਤੇ ਡਾਟਾਸੈੱਟਾਂ ਦਾ ਮਿਸ਼ਰਣ ਸ਼ਾਮਲ ਸਨ.

ਸੁਖਮ-ਅਨੁਕੂਲਨ ਡਾਟਾਸੈੱਟਾਂ ਵਜੋਂ ਅਸੀਂ VDR, ColPali ਸਿਖਲਾਈ ਸੈੱਟ, visrag_syn, ਅਤੇ visrag_ind ਚੁਣੇ. ਅਸੀਂ ਸੁਖਮ-ਅਨੁਕੂਲਨ ਲਈ UniMax ਨਮੂਨਾਕਰਨ ਵਰਤਿਆ. ਕਿਉਂਕਿ ਅਸੀਂ ਮਾਡਲ ਵਿਲੀਨ ਲਾਗੂ ਕੀਤਾ ਸੀ ਅਤੇ ਆਧਾਰ ਵਿਲੀਨ ਮਾਡਲ ਨੂੰ ਪਹਿਲਾਂ ਹੀ ਕੁਝ ਬਹੁ-ਮਾਧਿਅਮ ਪ੍ਰਾਪਤੀ ਸਮਰੱਥਾ ਵਿਰਾਸਤ ਵਿੱਚ ਮਿਲੀ ਸੀ, ਅਸੀਂ ਵੇਖਿਆ ਕਿ ਹੋਰ ਡਾਟਾਸੈੱਟ ਜੋੜਨ ਨਾਲ ਕਾਰਗੁਜ਼ਾਰੀ ਥੋੜ੍ਹੀ ਘਟਦੀ ਹੈ. ਇਸ ਲਈ ਅਸੀਂ ਹੋਰ ਡਾਟਾਸੈੱਟ ਨਹੀਂ ਜੋੜੇ.

ਸੁਖਮ-ਅਨੁਕੂਲਨ ਲਈ ਸਾਡੇ ਚੁਣੇ ਹਾਈਪਰ-ਪੈਰਾਮੀਟਰ ਇਹ ਹਨ:

LoRA ਰੈਂਕ

32

LoRA ਐਲਫ਼ਾ

32

LoRA ਟੀਚਾ ਮੋਡੀਊਲ

ਏਮਬੈਡਿੰਗ ਤੋਂ ਇਲਾਵਾ ਚਿੱਤਰ ਅਤੇ ਟੈਕਸਟ ਦੋਵਾਂ ਦੀਆਂ ਸਾਰੀਆਂ ਪਰਤਾਂ

ਸਿੱਖਣ ਦਰ

5e-5

ਵੱਧ ਤੋਂ ਵੱਧ ਦ੍ਰਿਸ਼ਟਮਾਨ ਟੋਕਨ

1280

ਸਿਖਲਾਈ ਯੁੱਗ

1

ਸਮੁੱਚਾ ਬੈਚ ਆਕਾਰ

512

ਸ਼ੁਰੂਆਤੀ ਗਰਮਾਹਟ ਅਨੁਪਾਤ

5%

3. “ColBERT” ਦੁਬਿਧਾ: ਉੱਚ ਕਾਰਗੁਜ਼ਾਰੀ ਬਨਾਮ ਸਟੋਰੇਜ ਲਾਗਤ

ਇਤਿਹਾਸਕ ਤੌਰ ਉੱਤੇ “ColBERT-ਸ਼ੈਲੀ” ਦੀਆਂ ਟੋਕਨ-ਪੱਧਰੀ ਏਮਬੈਡਿੰਗਾਂ ਵਰਤਣ ਵਾਲੇ ਮਾਡਲਾਂ, ਜਿਵੇਂ ColPali, ਨੇ ਸ਼ਾਨਦਾਰ ਕਾਰਗੁਜ਼ਾਰੀ ਦਿੱਤੀ ਪਰ ਸਟੋਰੇਜ ਲਾਗਤ ਬੇਹੱਦ ਉੱਚੀ ਸੀ. ਹਰ ਦ੍ਰਿਸ਼ਟਮਾਨ ਟੋਕਨ ਨੂੰ ਸੂਚੀਬੱਧ ਕਰਨ ਨਾਲ ਵਿਸ਼ਾਲ ਵੈਕਟਰ ਡਾਟਾਬੇਸ ਬਣੇ, ਜੋ ਉੱਦਮੀ ਪੱਧਰ ਲਈ ਬਹੁਤ ਮਹਿੰਗੇ ਸਨ.

  • ਅਨੁਕੂਲਨ ਰਣਨੀਤੀ: ਅਸੀਂ ਆਪਣੀਆਂ ਏਮਬੈਡਿੰਗਾਂ ਦੇ ਆਕਾਰ ਨੂੰ ਧਿਆਨ ਨਾਲ ਸੰਤੁਲਿਤ ਕਰਕੇ ਸਟੋਰੇਜ ਦੀ ਚੁਣੌਤੀ ਹੱਲ ਕੀਤੀ, ਤਾਂ ਜੋ ਵੱਧ ਤੋਂ ਵੱਧ ਕਾਰਗੁਜ਼ਾਰੀ ਬਰਕਰਾਰ ਰਹੇ ਅਤੇ ਸਟੋਰੇਜ ਲਾਗਤ ਬੇਕਾਬੂ ਨਾ ਹੋਵੇ. ਇਸ ਕੁਸ਼ਲ ਆਕਾਰ ਵਿੱਚ SOTA ਸ਼ੁੱਧਤਾ ਕਾਇਮ ਰੱਖਣ ਲਈ ਅਸੀਂ ਪ੍ਰਾਪਤੀ ਕਾਰਗੁਜ਼ਾਰੀ ਅਤੇ ਸਟੋਰੇਜ ਲਾਗਤ ਦਾ ਸਭ ਤੋਂ ਸੰਤੁਲਿਤ ਮੇਲ ਪ੍ਰਾਪਤ ਕਰਨ ਵਾਸਤੇ ਅਯਾਮ ਆਕਾਰ 320 ਚੁਣਿਆ.

    • ਆਧਾਰ: ਮਿਆਰੀ ਪਹੁੰਚ, ਜਿਵੇਂ NVIDIA Nemo-3B, ਨੂੰ 10 ਲੱਖ ਚਿੱਤਰਾਂ ਦੀਆਂ ਏਮਬੈਡਿੰਗਾਂ ਸਟੋਰ ਕਰਨ ਲਈ ਲਗਭਗ 10.3 TB ਚਾਹੀਦਾ ਹੈ (1,802 ਟੋਕਨ @ 3,072 ਅਯਾਮ).

    • ColQwen3: ਉਹੀ 10 ਲੱਖ ਚਿੱਤਰ ਸਿਰਫ਼ 0.82 TB ਵਿੱਚ ਸਟੋਰ ਕਰਦਾ ਹੈ (ਵੱਧ ਤੋਂ ਵੱਧ 1,280 ਟੋਕਨ @ 320 ਅਯਾਮ).

ColQwen3 ਕਲਾਉਡ ਬੁਨਿਆਦੀ ਢਾਂਚੇ ਦਾ ਬਜਟ ਬੇਕਾਬੂ ਕੀਤੇ ਬਿਨਾਂ SOTA ਪ੍ਰਾਪਤੀ ਸ਼ੁੱਧਤਾ ਹਾਸਲ ਕਰਦਾ ਹੈ.

ਮੁਲਾਂਕਣ ਦੇ ਨਤੀਜੇ

ਅਸੀਂ ViDoRe ਬੈਂਚਮਾਰਕ ਸੂਟ ਉੱਤੇ ਆਪਣੀ ਪਹੁੰਚ ਦੀ ਪੁਸ਼ਟੀ ਕੀਤੀ. ਨਤੀਜੇ ਪੁਸ਼ਟੀ ਕਰਦੇ ਹਨ ਕਿ ColQwen3 ਨਵੀਨਤਮ V3 ਅਤੇ V2 ਬੈਂਚਮਾਰਕਾਂ, ਅੰਗਰੇਜ਼ੀ ਤੇ ਬਹੁਭਾਸ਼ਾਈ ਦੋਵਾਂ, ਉੱਤੇ ਨਵੇਂ ਮਿਆਰ ਕਾਇਮ ਕਰਦਾ ਹੈ ਅਤੇ ਪੁਰਾਣੇ V1 ਕਾਰਜਾਂ ਉੱਤੇ ਵੀ ਸਿਖਰਲੇ ਪੱਧਰ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ.

ViDoRe v3 (ਨਵੀਨਤਮ)

ColQwen3-8B ਅੰਗਰੇਜ਼ੀ ਅਤੇ ਬਹੁਭਾਸ਼ਾਈ ਪ੍ਰਾਪਤੀ ਵਿੱਚ ਸਭ ਤੋਂ ਅੱਗੇ ਹੈ.

ਅੰਗਰੇਜ਼ੀ nDCG@5

ਮਾਡਲ

ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ

ਊਰਜਾ

ਵਿੱਤ

ਮਨੁੱਖੀ ਸਰੋਤ

ਉਦਯੋਗ

ਦਵਾਈ ਉਦਯੋਗ

ਭੌਤਿਕ ਵਿਗਿਆਨ

ਔਸਤ

-colqwen3-8b

0.7443

0.6491

0.6823

0.6421

0.5766

0.6665

0.4747

0.6113

-colqwen3-4b

0.7419

0.6023

0.6753

0.6037

0.5787

0.6612

0.4640

0.5934

nemo-colembed-3b

0.7514

0.5838

0.6712

0.6256

0.5447

0.6524

0.4128

0.5769

jina-embeddings-v4

0.7175

0.5842

0.6417

0.6206

0.5443

0.6303

0.4191

0.5680

ਬਹੁਭਾਸ਼ਾਈ nDCG@5

ਮਾਡਲ

ਕੰਪਿਊਟਰ ਵਿਗਿਆਨ

ਊਰਜਾ

ਵਿੱਤ

ਮਨੁੱਖੀ ਸਰੋਤ

ਉਦਯੋਗ

ਦਵਾਈ ਉਦਯੋਗ

ਭੌਤਿਕ ਵਿਗਿਆਨ

ਔਸਤ

-colqwen3-8b

0.7194

0.6619

0.6172

0.6097

0.5164

0.6403

0.4706

0.5866

-colqwen3-4b

0.7213

0.6374

0.6019

0.5637

0.5131

0.6351

0.4636

0.5708

nemo-colembed-3b

0.7216

0.5901

0.5646

0.5504

0.4335

0.6170

0.4192

0.5383

ViDoRe v2 ਅਤੇ v1 ਦੀਆਂ ਮੁੱਖ ਝਲਕਾਂ

ESG, ਅਰਥਸ਼ਾਸਤਰ ਅਤੇ DocVQA ਵਿੱਚ ਲਗਾਤਾਰ ਉੱਚ ਕਾਰਗੁਜ਼ਾਰੀ.

ਬੈਂਚਮਾਰਕ

ਮਾਡਲ

ਸਕੋਰ (ਔਸਤ)

ਜ਼ਿਕਰਯੋਗ ਜਿੱਤ

ViDoRe V2 (ਅੰਗਰੇਜ਼ੀ)

ColQwen3-8B

0.6772

ESG ਅਤੇ BioMed ਵਿੱਚ #1

ViDoRe V2 (ਬਹੁਭਾਸ਼ਾਈ)

ColQwen3-8B

0.6085

ਅਰਥਸ਼ਾਸਤਰ ਵਿੱਚ #1

ViDoRe V1 (ਅੰਗਰੇਜ਼ੀ)

Nemo ColEmbed 3B

0.9100

ਥੋੜ੍ਹੀ ਵੱਧ ਔਸਤ

ViDoRe V1 (ਅੰਗਰੇਜ਼ੀ)

ColQwen3-8B

0.9076

ArxivQA ਅਤੇ Syn-Gov ਵਿੱਚ #1

ਵੀਡੀਓ ਪ੍ਰਾਪਤੀ: CareBench ਮੁਲਾਂਕਣ

ਇਹ ਦਿਖਾਉਣ ਲਈ ਕਿ ColQwen3 ਵੀਡੀਓ ਪ੍ਰਾਪਤੀ ਲਈ ਵੀ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਸਧਾਰਨੀਕਰਨ ਕਰਦਾ ਹੈ, ਅਸੀਂ ਟੈਕਸਟ-ਤੋਂ-ਵੀਡੀਓ (ਆਮ ਪ੍ਰਾਪਤੀ) ਕਾਰਜਾਂ ਲਈ CareBench ਬੈਂਚਮਾਰਕ ਉੱਤੇ ਮਾਡਲਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ.

ਇਸ ਮੁਲਾਂਕਣ ਲਈ ਅਸੀਂ ਕੱਚੀ ਵੀਡੀਓ ਏਨਕੋਡਿੰਗ ਪਹੁੰਚ ਵਰਤੀ: ਸਾਡੇ ਮਾਡਲਾਂ ਨੇ ਬਿਨਾਂ ਕਿਸੇ ਵਾਧੂ ਲਿਖਤੀ ਟਿੱਪਣੀ ਜਾਂ ਮੈਟਾਡੇਟਾ ਇਨਪੁੱਟ ਦੇ ਵੀਡੀਓ ਫ਼ਾਈਲਾਂ ਨੂੰ ਸਿੱਧਾ ਏਨਕੋਡ ਕੀਤਾ. ਇਹ ਸਿਰਫ਼ ਦ੍ਰਿਸ਼ਟਮਾਨ ਅਰਥਾਂ ਦੇ ਆਧਾਰ ਉੱਤੇ ਪ੍ਰਾਪਤੀ ਕਰਨ ਦੀ ਮਾਡਲ ਦੀ ਸਮਰੱਥਾ ਦਰਸਾਉਂਦਾ ਹੈ.

ਮਾਡਲ

ਰੀਕਾਲ@1

ਰੀਕਾਲ@5

ਰੀਕਾਲ@10

-colqwen3-8b

0.8670

0.9590

0.9850

-colqwen3-4b

0.8620

0.9570

0.9800

Care7B

0.7700

0.9560

0.9870

“ਅਣਵਰਤਿਆ ਡਾਟਾ” ਖੋਲ੍ਹਣਾ: ਵੀਡੀਓ ਦਾ ਅਤਿ-ਆਧੁਨਿਕ ਖੇਤਰ

ColQwen3 ਨਾਲ ਆਏ ਸਭ ਤੋਂ ਵੱਡੇ ਬਦਲਾਵਾਂ ਵਿੱਚੋਂ ਇੱਕ ਹੈ ਵੀਡੀਓ ਨੂੰ ਦਸਤਾਵੇਜ਼ਾਂ ਵਾਂਗ ਵਰਤਣ ਦੀ ਸਮਰੱਥਾ. ਬਹੁਤ ਸਾਰੇ ਉੱਦਮਾਂ ਵਿੱਚ ਵੀਡੀਓ “ਅਣਵਰਤਿਆ ਡਾਟਾ” ਹੈ. ਇਹ ਠੰਢੀ ਸਟੋਰੇਜ ਵਿੱਚ ਪਿਆ ਰਹਿੰਦਾ ਹੈ ਅਤੇ ਉਦੋਂ ਤੱਕ ਖੋਜਿਆ ਨਹੀਂ ਜਾ ਸਕਦਾ ਜਦੋਂ ਤੱਕ ਕਿਸੇ ਮਨੁੱਖ ਨੇ ਹਰ ਫ਼ਾਈਲ ਨੂੰ ਹੱਥੀਂ ਟੈਗ ਨਾ ਕੀਤਾ ਹੋਵੇ.

ColQwen3 ਖੰਡਿਤ ਕਲਿੱਪਾਂ ਵਿੱਚ ਫਰੇਮ-ਵਾਰ ਪ੍ਰਾਪਤੀ ਸੰਭਵ ਬਣਾ ਕੇ ਇਸ ਨੂੰ ਬਦਲਦਾ ਹੈ.

ਵਰਤੋਂ ਦਾ ਪ੍ਰਮੁੱਖ ਮਾਮਲਾ: ਸੰਗਠਨਾਤਮਕ ਯਾਦਾਂ ਦਾ ਭੰਡਾਰ

ਉੱਦਮ ਹਰ ਰੋਜ਼ ਹਜ਼ਾਰਾਂ ਘੰਟਿਆਂ ਦੀਆਂ ਅੰਦਰੂਨੀ ਵੀਡੀਓ ਮੀਟਿੰਗਾਂ ਰਿਕਾਰਡ ਕਰਦੇ ਹਨ ਅਤੇ ਆਮ ਤੌਰ ਉੱਤੇ ਇਹ ਰਿਕਾਰਡਿੰਗਾਂ ਗੁੰਮਨਾਮ ਭੰਡਾਰ ਵਿੱਚ ਗੁਆਚ ਜਾਂਦੀਆਂ ਹਨ.

  • ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਮੀਟਿੰਗਾਂ ਦੀਆਂ ਲੰਮੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਆਪਣੇ-ਆਪ ਛੋਟੀਆਂ, ਤਰਕਸੰਗਤ ਕਲਿੱਪਾਂ ਵਿੱਚ ਵੰਡ ਕੇ ਅਤੇ ColQwen3 ਨਾਲ ਸੂਚੀਬੱਧ ਕਰਕੇ ਤੁਸੀਂ ਖੋਜਯੋਗ “ਸੰਗਠਨਾਤਮਕ ਯਾਦ” ਬਣਾਉਂਦੇ ਹੋ.

  • ਪੁੱਛਗਿੱਛ: ਕੋਈ ਪ੍ਰੋਜੈਕਟ ਪ੍ਰਬੰਧਕ ਪੁੱਛ ਸਕਦਾ ਹੈ: “ਮੈਨੂੰ ਉਹ ਕਲਿੱਪ ਦਿਖਾਓ ਜਿਸ ਵਿੱਚ ਇੰਜੀਨੀਅਰਿੰਗ ਮੁਖੀ ਨੇ API ਨਾਲ ਜੁੜੀ ਦੇਰੀ ਦੀ ਸਮੱਸਿਆ ਸਮਝਾਈ ਸੀ.”

  • ਨਤੀਜਾ: 60 ਮਿੰਟ ਦੀ ਵੀਡੀਓ ਫ਼ਾਈਲ ਦੇਣ ਦੀ ਬਜਾਏ ਸਿਸਟਮ ਠੀਕ ਉਹੀ 45 ਸਕਿੰਟ ਦਾ ਭਾਗ ਲੱਭਦਾ ਹੈ ਜਿਸ ਵਿੱਚ ਖ਼ਾਸ ਚਿੱਤਰ ਸਕ੍ਰੀਨ ਉੱਤੇ ਸਾਂਝਾ ਕਰਕੇ ਵਿਚਾਰਿਆ ਗਿਆ ਸੀ, ਭਾਵੇਂ ਬੋਲਣ ਵਾਲਿਆਂ ਨੇ ਉਸੇ ਪਲ “ਦੇਰੀ” ਸ਼ਬਦ ਸਪਸ਼ਟ ਤੌਰ ਉੱਤੇ ਨਾ ਕਿਹਾ ਹੋਵੇ.

ਉੱਦਮੀ ਵਰਤੋਂ ਦੇ ਮਾਮਲੇ: ਉੱਚ-ਮੁੱਲ ਵਾਲੀਆਂ ਸਮੱਸਿਆਵਾਂ ਦਾ ਹੱਲ

ਮੂਲ ਬਹੁ-ਮਾਧਿਅਮ ਏਮਬੈਡਿੰਗ ਵੱਲ ਬਦਲਾਅ ਉਦਯੋਗਾਂ ਵਿੱਚ ਬਿਲਕੁਲ ਨਵੇਂ ਕਾਰਜ-ਪ੍ਰਵਾਹ ਸੰਭਵ ਬਣਾਉਂਦਾ ਹੈ. ਅਸੀਂ ਸਭ ਤੋਂ ਜਟਿਲ ਉੱਦਮੀ ਡਾਟਾ ਮਾਹੌਲਾਂ ਵਿੱਚੋਂ ਕੁਝ ਦੇ ਮੁਕਾਬਲੇ ਇਸ ਮਾਡਲ ਦੀ ਵਿਆਪਕ ਬੈਂਚਮਾਰਕ ਜਾਂਚ ਕੀਤੀ ਹੈ.

1. ਬੈਂਚਮਾਰਕ ਦੀ ਮੁੱਖ ਝਲਕ: ਸ਼ਹਿਰੀ ਸਲਾਹਕਾਰੀ ਅਤੇ ਵਾਸਤੂਕਲਾ

ਅਸੀਂ ColQwen3 ਨੂੰ ਸ਼ਹਿਰੀ ਸਲਾਹਕਾਰੀ ਕੰਪਨੀਆਂ ਦੀਆਂ ਡਾਟਾ ਚੁਣੌਤੀਆਂ ਉੱਤੇ ਪਰਖਿਆ, ਜੋ ਮਾਸਟਰ ਪਲਾਨਾਂ, ਜ਼ੋਨਿੰਗ ਨਕਸ਼ਿਆਂ ਅਤੇ ਜਟਿਲ ਵਾਸਤੂਕਲਾ ਉਚਾਈ-ਚਿੱਤਰਾਂ ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿ ਸੰਭਾਲਦੀਆਂ ਹਨ.

  • ਚੁਣੌਤੀ: ਇਨ੍ਹਾਂ ਮਾਹੌਲਾਂ ਵਿੱਚ ਰਵਾਇਤੀ RAG ਪਾਈਪਲਾਈਨਾਂ ਨੂੰ ਮੁਸ਼ਕਲ ਆਉਂਦੀ ਹੈ. OCR ਸਾਧਨ ਆਮ ਤੌਰ ਉੱਤੇ ਜਟਿਲ ਸਾਈਟ ਯੋਜਨਾਵਾਂ ਨੂੰ ਸਿਰਫ਼ “ਰੂਪ-ਰੇਖਾ” ਕਹਿੰਦੇ ਹਨ ਅਤੇ ਆਵਾਜਾਈ ਦੇ ਵਹਾਅ, ਹਰੇ ਖੇਤਰਾਂ ਜਾਂ ਇਮਾਰਤਾਂ ਦੀ ਪਿੱਛੇ ਹਟਾਈ ਦੂਰੀ ਵਰਗੇ ਅਹਿਮ ਵੇਰਵੇ ਗੁਆ ਦਿੰਦੇ ਹਨ.

  • ਕਾਰਗੁਜ਼ਾਰੀ: ਸਾਡੇ ਅੰਦਰੂਨੀ ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ColQwen3 ਮਹਿੰਗੀ OCR/ਸਿਰਲੇਖਕਰਨ ਪੂਰਵ-ਪ੍ਰਕਿਰਿਆ ਦੀ ਲੋੜ ਨੂੰ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਟਾਲ ਦਿੰਦਾ ਹੈ. ਸੰਘਣੇ ਵਾਸਤੂਕਲਾ ਚਿੱਤਰਾਂ ਵਾਲੇ ਟੈਸਟਾਂ ਵਿੱਚ ਮਾਡਲ ਨੇ ਪੈਦਲ ਪਹੁੰਚ ਬਿੰਦੂਆਂ ਜਾਂ ਵੱਖਰੀਆਂ ਜ਼ੋਨਿੰਗ ਹੱਦਾਂ ਵਰਗੇ ਖ਼ਾਸ ਦ੍ਰਿਸ਼ਟਮਾਨ ਚਿੰਨ੍ਹਾਂ ਦੇ ਆਧਾਰ ਉੱਤੇ ਦਸਤਾਵੇਜ਼ ਸਫਲਤਾਪੂਰਵਕ ਲੱਭੇ. ਇਸ ਨੇ ਸਿਰਫ਼ ਟੈਕਸਟ ਵਾਲੇ ਆਧਾਰਾਂ ਨਾਲੋਂ ਕਾਫ਼ੀ ਬਿਹਤਰ ਨਤੀਜੇ ਦਿੱਤੇ ਅਤੇ ਗਿਆਨ ਗ੍ਰਹਿਣ ਦੀ ਲਾਗਤ ਵਿੱਚ ਵੱਡੀ ਕਮੀ ਦੀ ਸੰਭਾਵਨਾ ਦਿਖਾਈ.

2. ਜਟਿਲ ਵਿੱਤੀ ਅਤੇ ਬਾਜ਼ਾਰ ਇੰਟੈਲੀਜੈਂਸ

ਨਿਵੇਸ਼ ਬੈਂਕਰ ਅਤੇ ਵਿਸ਼ਲੇਸ਼ਕ ਸਾਲਾਨਾ ਰਿਪੋਰਟਾਂ ਤੇ ਨਿਵੇਸ਼ਕ ਪੇਸ਼ਕਾਰੀਆਂ ਖੰਗਾਲਣ ਵਿੱਚ ਹਜ਼ਾਰਾਂ ਘੰਟੇ ਲਾਉਂਦੇ ਹਨ.

  • ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਵਿਸ਼ਲੇਸ਼ਕ ਪੁੱਛ ਸਕਦਾ ਹੈ, “2024 ਦੀਆਂ ਸਲਾਈਡ ਪੇਸ਼ਕਾਰੀਆਂ ਵਿੱਚੋਂ APAC ਅਤੇ EMEA ਆਮਦਨ ਦਾ ਵੇਰਵਾ ਲੱਭੋ.”

  • ਬਦਲਾਅ: ਮੁੱਖ ਸ਼ਬਦਾਂ ਦੇ ਮੇਲ ਉੱਤੇ ਨਿਰਭਰ ਰਹਿਣ ਦੀ ਬਜਾਏ ਮਾਡਲ ਖ਼ਾਸ ਡਾਟਾ-ਦ੍ਰਿਸ਼ਟੀਕਰਨ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਮੌਜੂਦਗੀ ਦੇ ਆਧਾਰ ਉੱਤੇ ਸਹੀ ਸਲਾਈਡ ਲੱਭਦਾ ਹੈ, ਜਿਸ ਨਾਲ RAG ਸਿਸਟਮ ਬਹੁਤ ਸਟੀਕ ਜਵਾਬ ਦੇ ਸਕਦਾ ਹੈ.

3. ਉਦਯੋਗਿਕ ਨਿਰਮਾਣ ਅਤੇ ਖੇਤਰੀ ਸੇਵਾ

ਨਿਰਮਾਣ ਕੰਪਨੀਆਂ ਕੋਲ ਤਕਨੀਕੀ ਦਸਤਾਵੇਜ਼ਾਂ ਅਤੇ ਪਾਈਪਿੰਗ ਚਿੱਤਰਾਂ (P&IDs) ਦੇ ਵਿਸ਼ਾਲ ਸੰਗ੍ਰਹਿ ਹੁੰਦੇ ਹਨ.

  • ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਟਰਬਾਈਨ ਠੀਕ ਕਰ ਰਿਹਾ ਖੇਤਰੀ ਇੰਜੀਨੀਅਰ ਕਿਸੇ ਪੁਰਜ਼ੇ ਦੀ ਫ਼ੋਟੋ ਲੈ ਸਕਦਾ ਹੈ ਜਾਂ ਪੁੱਛ ਸਕਦਾ ਹੈ, “ਮੈਨੂੰ ਹਾਈਡ੍ਰੌਲਿਕ ਪੰਪ ਅਸੈਂਬਲੀ ਦਾ ਤਾਰਬੰਦੀ ਚਿੱਤਰ ਦਿਖਾਓ.”

  • ਬਦਲਾਅ: ColQwen3 ਤਾਰਬੰਦੀ ਚਿੱਤਰ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਪੇਸ਼ਕਾਰੀ ਪਛਾਣ ਕੇ ਸਹੀ ਸਫ਼ਾ ਲੱਭਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਬੰਦ ਰਹਿਣ ਦਾ ਸਮਾਂ ਕਈ ਘੰਟੇ ਘਟ ਸਕਦਾ ਹੈ.

4. ਕਾਨੂੰਨੀ ਅਤੇ ਪਾਲਣਾ

ਕਾਨੂੰਨੀ ਖੋਜ ਵਿੱਚ ਲੱਖਾਂ ਸਕੈਨ ਕੀਤੇ ਸਫ਼ਿਆਂ ਦੀ ਸਮੀਖਿਆ ਹੁੰਦੀ ਹੈ, ਜਿੱਥੇ ਲੱਭੀ ਜਾਣ ਵਾਲੀ ਅਹਿਮ ਚੀਜ਼ ਅਕਸਰ ਕੋਈ ਦ੍ਰਿਸ਼ਟਮਾਨ ਚਿੰਨ੍ਹ ਹੁੰਦੀ ਹੈ.

  • ਕਾਰਜ-ਪ੍ਰਵਾਹ: ਪਾਲਣਾ ਅਧਿਕਾਰੀ “CFO ਵੱਲੋਂ ਦਸਤਖ਼ਤ ਕੀਤੇ ਦਸਤਾਵੇਜ਼” ਜਾਂ “ਅਧਿਕਾਰਤ ‘ਗੁਪਤ’ ਮੋਹਰ ਵਾਲੇ ਇਕਰਾਰਨਾਮੇ” ਖੋਜ ਸਕਦਾ ਹੈ.

  • ਬਦਲਾਅ: ਮਾਡਲ ਦਸਤਖ਼ਤਾਂ ਜਾਂ ਮੋਹਰਾਂ ਦੀ ਦ੍ਰਿਸ਼ਟਮਾਨ ਮੌਜੂਦਗੀ ਦੇ ਆਧਾਰ ਉੱਤੇ ਖਰੜੇ ਅਤੇ ਅੰਤਿਮ ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਫ਼ਰਕ ਕਰਦਾ ਹੈ, ਜੋ ਸਿਰਫ਼ OCR ਅਕਸਰ ਨਹੀਂ ਪਛਾਣਦਾ.

ਸ਼ੁਰੂਆਤ ਕਰੋ

ColQwen3 ਖੁੱਲ੍ਹੇ ਭਾਰਾਂ ਵਾਲਾ (Apache 2.0) ਹੈ ਅਤੇ ਹੁਣ Hugging Face ਉੱਤੇ ਉਪਲਬਧ ਹੈ. ਅਸੀਂ ਇਸ ਨੂੰ ਆਧੁਨਿਕ RAG ਪਾਈਪਲਾਈਨਾਂ ਲਈ ਸਿੱਧੇ ਬਦਲ ਵਜੋਂ ਤਿਆਰ ਕੀਤਾ ਹੈ ਅਤੇ ਟੈਕਸਟ, ਚਿੱਤਰ ਤੇ ਵੀਡੀਓ ਤੁਰੰਤ ਪ੍ਰਕਿਰਿਆ ਕਰਨ ਲਈ ਲੋੜੀਂਦਾ ਅਨੁਮਾਨ ਕੋਡ ਦਿੱਤਾ ਹੈ.

ਸਾਦੀ ਟੈਕਸਟ ਖੋਜ ਤੋਂ ਅੱਗੇ ਵਧ ਕੇ ਆਪਣੀਆਂ ਦ੍ਰਿਸ਼ਟਮਾਨ ਸੰਪਤੀਆਂ ਵਿੱਚ ਬੰਦ ਇੰਟੈਲੀਜੈਂਸ ਨੂੰ ਵਰਤਣ ਲਈ ਤਿਆਰ ਉੱਦਮਾਂ ਵਾਸਤੇ ਇਹ ਨਵਾਂ ਮਿਆਰ ਹੈ.

ਅਗਲਾ ਕਦਮ: ਮਾਡਲ ਕਾਰਡ ਵੇਖੋ ਅਤੇ Hugging Face ਉੱਤੇ ਸਿੱਧਾ ਪ੍ਰਦਰਸ਼ਨ ਅਜ਼ਮਾਓ: /-colqwen3-embed-8b ਅਤੇ /-colqwen3-embed-4b

ਲੇਖਕ

Xin Huang, Kye Min Tan