ਪੂਰੀ ਗੱਲ ਮੁੱਕਣ ਦੀ ਉਡੀਕ ਤੋਂ ਬਿਨਾਂ ਬੋਲਦੇ ਸਮੇਂ ਲਿਖਤ ਦਿਖਾਉਣ ਲਈ Microsoft ਨੇ MAI-Transcribe-2-Streaming ਪੇਸ਼ ਕੀਤਾ ਹੈ। ਕੰਪਨੀ ਦੇ 1 ਅਕਤੂਬਰ 2026 ਦੇ ਐਲਾਨ ਮੁਤਾਬਕ ਇਹ ਮਾਡਲ 60 ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਕੰਮ ਕਰਦਾ ਹੈ ਅਤੇ ਚੱਲਦੀ ਗੱਲਬਾਤ ਵਿੱਚ ਭਾਸ਼ਾ ਦੀ ਪਛਾਣ ਆਪ ਕਰ ਸਕਦਾ ਹੈ।
ਆਵਾਜ਼ ਨੂੰ ਲਿਖਤ ਵਿੱਚ ਬਦਲਣ ਵਾਲੀਆਂ ਸੇਵਾਵਾਂ ਆਨਲਾਈਨ ਬੈਠਕਾਂ, ਕਲਾਸਾਂ ਅਤੇ ਗਾਹਕ ਸਹਾਇਤਾ ਵਿੱਚ ਵਰਤੀਆਂ ਜਾ ਸਕਦੀਆਂ ਹਨ। PunjabiTime ਦੀ ਤਕਨਾਲੋਜੀ ਕਵਰੇਜ ਵਿੱਚ ਇਸ ਰਿਲੀਜ਼ ਦੀ ਅਹਿਮੀਅਤ ਇਸ ਦਾ ਚੱਲਦੀ ਆਵਾਜ਼ ਨਾਲ ਕੰਮ ਕਰਨਾ ਹੈ, ਪੂਰੀ ਰਿਕਾਰਡਿੰਗ ਭੇਜਣ ਤੋਂ ਬਾਅਦ ਲਿਖਤ ਬਣਾਉਣਾ ਨਹੀਂ।
ਪਹਿਲੀ ਲਿਖਤ ਬਾਅਦ ਵਿੱਚ ਸੋਧ ਸਕਦੀ ਹੈ
Microsoft ਦੇ ਐਲਾਨ ਅਨੁਸਾਰ ਆਵਾਜ਼ ਮਿਲਣ ਤੋਂ ਕੁਝ ਵੱਧ 100 ਮਿਲੀਸਕਿੰਟ ਵਿੱਚ ਪਹਿਲਾ ਅਸਥਾਈ ਨਤੀਜਾ ਆ ਸਕਦਾ ਹੈ। ਹੋਰ ਸ਼ਬਦ ਅਤੇ ਸੰਦਰਭ ਮਿਲਣ ਉੱਤੇ ਮਾਡਲ ਪਹਿਲੀ ਲਿਖਤ ਸੋਧਦਾ ਹੈ ਅਤੇ ਫਿਰ ਪੱਕਾ ਹਿੱਸਾ ਦਿੰਦਾ ਹੈ।
ਇਸ ਲਈ ਸਕ੍ਰੀਨ ਉੱਤੇ ਸਭ ਤੋਂ ਪਹਿਲਾਂ ਆਇਆ ਸ਼ਬਦ ਅੰਤਿਮ ਲਿਖਤ ਨਹੀਂ ਮੰਨਿਆ ਜਾਣਾ ਚਾਹੀਦਾ। ਬੋਲਣ ਵਾਲਾ ਅੱਗੇ ਕੀ ਕਹਿੰਦਾ ਹੈ, ਉਸ ਨਾਲ ਪਹਿਲੇ ਅੰਦਾਜ਼ੇ ਵਿੱਚ ਤਬਦੀਲੀ ਆ ਸਕਦੀ ਹੈ। ਤੁਰੰਤ ਉਪਸਿਰਲੇਖ ਜਾਂ ਨੋਟ ਬਣਾਉਣ ਵੇਲੇ ਇਹ ਫ਼ਰਕ ਵਰਤੋਂਕਾਰ ਨੂੰ ਸਮਝ ਆਉਣਾ ਲੋੜੀਂਦਾ ਹੈ।
ਕੰਪਨੀ ਨੇ ਇਸ ਮਾਡਲ ਲਈ ਸਾਲ ਦੇ ਅੰਤ ਤੱਕ ਪ੍ਰਤੀ ਘੰਟਾ ਆਵਾਜ਼ 0.54 ਅਮਰੀਕੀ ਡਾਲਰ ਦੀ ਸ਼ੁਰੂਆਤੀ ਦਰ ਦੱਸੀ ਹੈ। ਇਹ ਸਿਰਫ਼ ਮਾਡਲ ਦੀ ਘੋਸ਼ਿਤ ਦਰ ਹੈ; ਇਸ ਨੂੰ ਪੂਰੀ ਸੇਵਾ ਬਣਾਉਣ ਜਾਂ ਚਲਾਉਣ ਦਾ ਕੁੱਲ ਖ਼ਰਚ ਨਹੀਂ ਮੰਨਿਆ ਜਾ ਸਕਦਾ।
ਇਸੇ ਐਲਾਨ ਵਿੱਚ MAI-Voice-2.1 ਅਤੇ MAI-Voice-2.1-Flash ਵੀ ਪੇਸ਼ ਹੋਏ। ਇਹ ਲਿਖਤ ਨੂੰ ਆਵਾਜ਼ ਵਿੱਚ ਬਦਲਣ ਵਾਲੇ ਮਾਡਲ ਹਨ ਅਤੇ ਕੰਪਨੀ ਮੁਤਾਬਕ 23 ਭਾਸ਼ਾਵਾਂ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ। ਉਨ੍ਹਾਂ ਦੀ 23 ਭਾਸ਼ਾਵਾਂ ਵਾਲੀ ਗਿਣਤੀ ਨੂੰ ਲਿਖਤ ਬਣਾਉਣ ਵਾਲੇ ਮਾਡਲ ਦੀ 60 ਭਾਸ਼ਾਵਾਂ ਨਾਲ ਨਹੀਂ ਮਿਲਾਉਣਾ ਚਾਹੀਦਾ।
ਅਜ਼ਮਾਇਸ਼ ਅਤੇ ਮਾਪਦੰਡ ਦੀ ਹੱਦ
Azure ਦੇ ਅਧਿਕਾਰਤ ਵੇਰਵੇ ਇਸ ਸੇਵਾ ਨੂੰ ਜਨਤਕ ਅਜ਼ਮਾਇਸ਼ ਦੱਸਦੇ ਹਨ। ਦਸਤਾਵੇਜ਼ ਵਿੱਚ ਸੇਵਾ-ਪੱਧਰ ਦੀ ਗਾਰੰਟੀ ਨਾ ਹੋਣ ਅਤੇ ਅਸਲ ਉਤਪਾਦਨ ਵਾਲੇ ਕੰਮ ਲਈ ਸਿਫ਼ਾਰਸ਼ ਨਾ ਕਰਨ ਦੀ ਸ਼ਰਤ ਵੀ ਹੈ।
Microsoft ਨੇ Artificial Analysis ਦੇ ਮਾਪਦੰਡ ਵਿੱਚ ਅਸਥਾਈ ਅਤੇ ਅੰਤਿਮ ਲਿਖਤ ਦੀ ਸਹੀਪਣ ਰੈਂਕਿੰਗ ਵਿੱਚ ਪਹਿਲਾ ਸਥਾਨ ਹੋਣ ਦਾ ਦਾਅਵਾ ਕੀਤਾ ਹੈ। ਮਾਪਦੰਡ ਦੇ ਆਪਣੇ ਵੇਰਵੇ ਮੁਤਾਬਕ ਇਹ ਤਿੰਨ ਆਵਾਜ਼ ਸੰਗ੍ਰਹਿਆਂ ਦੇ ਲਗਭਗ ਅੱਠ ਘੰਟਿਆਂ ਉੱਤੇ ਆਧਾਰਿਤ ਹੈ।
ਰਿਲੀਜ਼ ਦੇ ਤਕਨੀਕੀ ਅੰਕੜਿਆਂ ਦਾ ਆਧਾਰ ਮੁੱਖ ਤੌਰ ਉੱਤੇ ਕੰਪਨੀ ਦੀ ਘੋਸ਼ਣਾ ਅਤੇ ਦਸਤਾਵੇਜ਼ ਹਨ। ਪੰਜਾਬੀ ਬੋਲੀਆਂ ਜਾਂ ਪੰਜਾਬੀ-ਅੰਗਰੇਜ਼ੀ ਮਿਲੀ ਗੱਲਬਾਤ ਲਈ ਵੱਖਰਾ ਨਤੀਜਾ ਇੱਥੇ ਤਸਦੀਕ ਨਹੀਂ ਹੋਇਆ। ਆਪਣੀ ਰਿਕਾਰਡਿੰਗ, ਨਾਮਾਂ ਅਤੇ ਅੰਕੜਿਆਂ ਨਾਲ ਜਾਂਚ ਕੀਤੇ ਬਿਨਾਂ ਰੈਂਕਿੰਗ ਨੂੰ ਉਸ ਵਰਤੋਂ ਵਿੱਚ ਬੇਗ਼ਲਤੀ ਕੰਮ ਕਰਨ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਮੰਨਣਾ ਚਾਹੀਦਾ।
