ਕੇਸ ਸਟੱਡੀ: ਗੱਲਬਾਤ ਸੰਬੰਧੀ ਏ.ਆਈ

3 ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ASR ਬਣਾਉਣ ਲਈ 8 ਹਜ਼ਾਰ ਘੰਟਿਆਂ ਤੋਂ ਵੱਧ ਦਾ ਡੇਟਾ ਇਕੱਠਾ ਕੀਤਾ, ਵੰਡਿਆ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤਾ ਗਿਆ

ਗੱਲਬਾਤ ਏ.ਆਈ

ਸਰਕਾਰ ਦਾ ਉਦੇਸ਼ ਭਾਸ਼ਿਨੀ ਪ੍ਰੋਜੈਕਟ ਰਾਹੀਂ ਆਪਣੇ ਨਾਗਰਿਕਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀ ਆਪਣੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਇੰਟਰਨੈਟ ਅਤੇ ਡਿਜੀਟਲ ਸੇਵਾਵਾਂ ਤੱਕ ਆਸਾਨ ਪਹੁੰਚ ਪ੍ਰਦਾਨ ਕਰਨਾ ਹੈ।

ਭਾਸ਼ਿਨੀ, ਭਾਰਤ ਦਾ AI-ਸੰਚਾਲਿਤ ਭਾਸ਼ਾ ਅਨੁਵਾਦ ਪਲੇਟਫਾਰਮ, ਡਿਜੀਟਲ ਇੰਡੀਆ ਪਹਿਲਕਦਮੀ ਦਾ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਹਿੱਸਾ ਹੈ।

MSMEs, ਸਟਾਰਟਅੱਪਸ, ਅਤੇ ਸੁਤੰਤਰ ਇਨੋਵੇਟਰਾਂ ਨੂੰ ਆਰਟੀਫੀਸ਼ੀਅਲ ਇੰਟੈਲੀਜੈਂਸ (AI) ਅਤੇ ਨੈਚੁਰਲ ਲੈਂਗੂਏਜ ਪ੍ਰੋਸੈਸਿੰਗ (NLP) ਟੂਲ ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ, ਭਾਸ਼ਿਨੀ ਪਲੇਟਫਾਰਮ ਇੱਕ ਜਨਤਕ ਸਰੋਤ ਵਜੋਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਇਸਦਾ ਟੀਚਾ ਭਾਰਤੀ ਨਾਗਰਿਕਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀਆਂ ਮੂਲ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਦੇਸ਼ ਦੀਆਂ ਡਿਜੀਟਲ ਪਹਿਲਕਦਮੀਆਂ ਨਾਲ ਗੱਲਬਾਤ ਕਰਨ ਦੇ ਯੋਗ ਬਣਾ ਕੇ ਡਿਜੀਟਲ ਸ਼ਮੂਲੀਅਤ ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਨਾ ਹੈ।

ਇਸ ਤੋਂ ਇਲਾਵਾ, ਇਸਦਾ ਉਦੇਸ਼ ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਇੰਟਰਨੈਟ ਸਮੱਗਰੀ ਦੀ ਉਪਲਬਧਤਾ ਨੂੰ ਮਹੱਤਵਪੂਰਣ ਰੂਪ ਵਿੱਚ ਵਧਾਉਣਾ ਹੈ। ਇਹ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਜਨਤਕ ਹਿੱਤ ਦੇ ਖੇਤਰਾਂ ਜਿਵੇਂ ਕਿ ਸ਼ਾਸਨ ਅਤੇ ਨੀਤੀ, ਵਿਗਿਆਨ ਅਤੇ ਤਕਨਾਲੋਜੀ, ਆਦਿ ਵੱਲ ਨਿਸ਼ਾਨਾ ਹੈ। ਸਿੱਟੇ ਵਜੋਂ, ਇਹ ਨਾਗਰਿਕਾਂ ਨੂੰ ਉਹਨਾਂ ਦੀ ਸਰਗਰਮ ਭਾਗੀਦਾਰੀ ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਦੇ ਹੋਏ, ਉਹਨਾਂ ਦੀ ਆਪਣੀ ਭਾਸ਼ਾ ਵਿੱਚ ਇੰਟਰਨੈਟ ਦੀ ਵਰਤੋਂ ਕਰਨ ਲਈ ਉਤਸ਼ਾਹਿਤ ਕਰੇਗਾ।

ਅਸਲ ਸੰਸਾਰ ਹੱਲ

ਡੇਟਾ ਦੇ ਨਾਲ ਸਥਾਨਕਕਰਨ ਦੀ ਸ਼ਕਤੀ ਨੂੰ ਜਾਰੀ ਕਰਨਾ

ਭਾਰਤ ਨੂੰ ਇੱਕ ਅਜਿਹੇ ਪਲੇਟਫਾਰਮ ਦੀ ਲੋੜ ਸੀ ਜੋ ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਡਿਜੀਟਲ ਸੇਵਾਵਾਂ ਪ੍ਰਦਾਨ ਕਰਨ ਲਈ ਬਹੁ-ਭਾਸ਼ਾਈ ਡੇਟਾਸੈੱਟ ਅਤੇ ਏਆਈ-ਅਧਾਰਤ ਭਾਸ਼ਾ ਤਕਨਾਲੋਜੀ ਹੱਲ ਬਣਾਉਣ 'ਤੇ ਕੇਂਦ੍ਰਿਤ ਹੋਵੇ। ਇਸ ਪਹਿਲਕਦਮੀ ਨੂੰ ਸ਼ੁਰੂ ਕਰਨ ਲਈ, ਇੰਡੀਅਨ ਇੰਸਟੀਚਿਊਟ ਆਫ਼ ਟੈਕਨਾਲੋਜੀ, ਮਦਰਾਸ (ਆਈਆਈਟੀ ਮਦਰਾਸ) ਨੇ ਬਹੁ-ਭਾਸ਼ਾਈ ਭਾਸ਼ਣ ਮਾਡਲ ਬਣਾਉਣ ਲਈ ਭਾਰਤੀ ਭਾਸ਼ਾ ਡੇਟਾਸੈੱਟਾਂ ਨੂੰ ਇਕੱਠਾ ਕਰਨ, ਵੰਡਣ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨ ਲਈ ਸ਼ੈਪ ਨਾਲ ਭਾਈਵਾਲੀ ਕੀਤੀ।

ਚੁਣੌਤੀ

ਕਲਾਇੰਟ ਦੀ ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਲਈ ਸਪੀਚ ਟੈਕਨਾਲੋਜੀ ਸਪੀਚ ਰੋਡਮੈਪ ਵਿੱਚ ਸਹਾਇਤਾ ਕਰਨ ਲਈ, ਟੀਮ ਨੂੰ AI ਮਾਡਲ ਬਣਾਉਣ ਲਈ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ ਪ੍ਰਾਪਤ ਕਰਨ, ਵੰਡਣ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨ ਦੀ ਲੋੜ ਸੀ। ਗਾਹਕ ਦੀਆਂ ਮਹੱਤਵਪੂਰਨ ਲੋੜਾਂ ਸਨ:

ਡਾਟਾ ਇਕੱਤਰ ਕਰਨਾ

  • ਪ੍ਰਤੀ ਭਾਸ਼ਾ 3000 ਉਪਭਾਸ਼ਾਵਾਂ ਦੇ ਨਾਲ 8 ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ 4 ਘੰਟਿਆਂ ਦਾ ਸਿਖਲਾਈ ਡੇਟਾ ਪ੍ਰਾਪਤ ਕਰੋ।
  • ਹਰੇਕ ਭਾਸ਼ਾ ਲਈ, ਸਪਲਾਇਰ Extempore Speech ਅਤੇ
    18-60 ਸਾਲ ਦੇ ਉਮਰ ਸਮੂਹਾਂ ਤੋਂ ਗੱਲਬਾਤ ਸੰਬੰਧੀ ਭਾਸ਼ਣ
  • ਉਮਰ, ਲਿੰਗ, ਸਿੱਖਿਆ ਅਤੇ ਉਪਭਾਸ਼ਾਵਾਂ ਦੁਆਰਾ ਬੁਲਾਰਿਆਂ ਦੇ ਵਿਭਿੰਨ ਮਿਸ਼ਰਣ ਨੂੰ ਯਕੀਨੀ ਬਣਾਓ
  • ਨਿਰਧਾਰਨ ਦੇ ਅਨੁਸਾਰ ਰਿਕਾਰਡਿੰਗ ਵਾਤਾਵਰਨ ਦੇ ਵਿਭਿੰਨ ਮਿਸ਼ਰਣ ਨੂੰ ਯਕੀਨੀ ਬਣਾਓ।
  • ਹਰੇਕ ਆਡੀਓ ਰਿਕਾਰਡਿੰਗ ਘੱਟੋ-ਘੱਟ 16kHz ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ ਪਰ ਤਰਜੀਹੀ ਤੌਰ 'ਤੇ 44kHz ਹੋਣੀ ਚਾਹੀਦੀ ਹੈ

ਡਾਟਾ ਸੈਗਮੈਂਟੇਸ਼ਨ

  • 15 ਸਕਿੰਟਾਂ ਦੇ ਸਪੀਚ ਸੈਗਮੈਂਟ ਬਣਾਓ ਅਤੇ ਗੱਲਬਾਤ ਵਿੱਚ ਹਰੇਕ ਦਿੱਤੇ ਸਪੀਕਰ, ਆਵਾਜ਼ ਦੀ ਕਿਸਮ (ਭਾਸ਼ਣ, ਬੋਲ, ਸੰਗੀਤ, ਸ਼ੋਰ), ਵਾਰੀ, ਵਾਕਾਂਸ਼ ਅਤੇ ਵਾਕਾਂਸ਼ਾਂ ਲਈ ਔਡੀਓ ਨੂੰ ਮਿਲੀਸਕਿੰਟ ਵਿੱਚ ਟਾਈਮਸਟੈਂਪ ਕਰੋ
  • ਸ਼ੁਰੂ ਅਤੇ ਅੰਤ 'ਤੇ 200-400 ਮਿਲੀਸਕਿੰਟ ਪੈਡਿੰਗ ਦੇ ਨਾਲ ਇਸਦੇ ਨਿਸ਼ਾਨੇ ਵਾਲੇ ਧੁਨੀ ਸਿਗਨਲ ਲਈ ਹਰੇਕ ਹਿੱਸੇ ਨੂੰ ਬਣਾਓ।
  • ਸਾਰੇ ਖੰਡਾਂ ਲਈ, ਹੇਠ ਲਿਖੀਆਂ ਵਸਤੂਆਂ ਭਰੀਆਂ ਜਾਣੀਆਂ ਚਾਹੀਦੀਆਂ ਹਨ ਜਿਵੇਂ ਕਿ, ਸ਼ੁਰੂਆਤੀ ਸਮਾਂ, ਸਮਾਪਤੀ ਸਮਾਂ, ਖੰਡ ID, ਉੱਚੀ ਪੱਧਰ, ਆਵਾਜ਼ ਦੀ ਕਿਸਮ, ਭਾਸ਼ਾ ਕੋਡ, ਸਪੀਕਰ ID, ਆਦਿ।

ਡਾਟਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ

  • ਅੱਖਰਾਂ ਅਤੇ ਵਿਸ਼ੇਸ਼ ਚਿੰਨ੍ਹਾਂ, ਸਪੈਲਿੰਗ ਅਤੇ ਵਿਆਕਰਨ, ਕੈਪੀਟਲਾਈਜ਼ੇਸ਼ਨ, ਸੰਖੇਪ, ਸੰਕੁਚਨ, ਵਿਅਕਤੀਗਤ ਬੋਲੇ ​​ਜਾਣ ਵਾਲੇ ਅੱਖਰ, ਸੰਖਿਆਵਾਂ, ਵਿਰਾਮ ਚਿੰਨ੍ਹ, ਸੰਖੇਪ ਸ਼ਬਦ, ਵਿਘਨ, ਸਪੀਚ, ਅਸਪੱਸ਼ਟ ਭਾਸ਼ਣ, ਗੈਰ-ਨਿਸ਼ਾਨਾ ਭਾਸ਼ਾਵਾਂ, ਗੈਰ-ਨਿਸ਼ਾਨਾ ਆਦਿ ਦੇ ਆਲੇ ਦੁਆਲੇ ਵੇਰਵੇ ਪ੍ਰਤੀਲਿਪੀ ਦਿਸ਼ਾ ਨਿਰਦੇਸ਼ਾਂ ਦੀ ਪਾਲਣਾ ਕਰੋ।

ਗੁਣਵੱਤਾ ਜਾਂਚ ਅਤੇ ਫੀਡਬੈਕ

  • ਗੁਣਵੱਤਾ ਦੇ ਮੁਲਾਂਕਣ ਅਤੇ ਪ੍ਰਮਾਣਿਕਤਾ ਤੋਂ ਗੁਜ਼ਰਨ ਲਈ ਸਾਰੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ, ਸਿਰਫ ਪ੍ਰਮਾਣਿਤ ਭਾਸ਼ਣ ਦਿੱਤਾ ਜਾਣਾ ਹੈ

ਦਾ ਹੱਲ

ਗੱਲਬਾਤ ਵਾਲੇ AI ਦੀ ਸਾਡੀ ਡੂੰਘੀ ਸਮਝ ਦੇ ਨਾਲ, ਅਸੀਂ ਕਲਾਇੰਟ ਨੂੰ ਮਾਹਰ ਕੁਲੈਕਟਰਾਂ, ਭਾਸ਼ਾ ਵਿਗਿਆਨੀਆਂ ਅਤੇ ਐਨੋਟੇਟਰਾਂ ਦੀ ਇੱਕ ਟੀਮ ਨਾਲ ਡੇਟਾ ਇਕੱਠਾ ਕਰਨ, ਵੰਡਣ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨ ਵਿੱਚ ਮਦਦ ਕੀਤੀ ਤਾਂ ਜੋ 8 ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਆਡੀਓ ਡੇਟਾਸੈਟ ਦਾ ਇੱਕ ਵੱਡਾ ਸੰਗ੍ਰਹਿ ਬਣਾਇਆ ਜਾ ਸਕੇ।

ਸ਼ਾਈਪ ਦੇ ਕੰਮ ਦੇ ਦਾਇਰੇ ਵਿੱਚ ਵੱਡੀ ਮਾਤਰਾ ਵਿੱਚ ਆਡੀਓ ਸਿਖਲਾਈ ਡੇਟਾ ਪ੍ਰਾਪਤ ਕਰਨਾ, ਆਡੀਓ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਕਈ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡਣਾ, ਡੇਟਾ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕਰਨਾ ਅਤੇ ਮੈਟਾਡੇਟਾ [ਸਪੀਕਰ ਆਈਡੀ, ਉਮਰ, ਲਿੰਗ, ਭਾਸ਼ਾ, ਉਪਭਾਸ਼ਾ, ਮਾਤ ਭਾਸ਼ਾ, ਯੋਗਤਾ, ਕਿੱਤਾ, ਡੋਮੇਨ, ਫਾਈਲ ਫਾਰਮੈਟ, ਬਾਰੰਬਾਰਤਾ, ਚੈਨਲ, ਆਡੀਓ ਦੀ ਕਿਸਮ, ਬੁਲਾਰਿਆਂ ਦੀ ਗਿਣਤੀ, ਵਿਦੇਸ਼ੀ ਭਾਸ਼ਾਵਾਂ ਦੀ ਗਿਣਤੀ, ਵਰਤੀ ਗਈ ਸੈੱਟਅੱਪ, ਨੈਰੋਬੈਂਡ ਜਾਂ ਵਾਈਡਬੈਂਡ ਆਡੀਓ, ਆਦਿ] ਵਾਲੀਆਂ ਸੰਬੰਧਿਤ JSON ਫਾਈਲਾਂ ਪ੍ਰਦਾਨ ਕਰਨਾ ਸ਼ਾਮਲ ਸੀ ਪਰ ਇਹਨਾਂ ਤੱਕ ਸੀਮਿਤ ਨਹੀਂ ਸੀ।

ਸ਼ੈਪ ਨੇ ਗੁੰਝਲਦਾਰ ਪ੍ਰੋਜੈਕਟਾਂ ਲਈ ਸਪੀਚ ਟੈਕਨਾਲੋਜੀ ਨੂੰ ਸਿਖਲਾਈ ਦੇਣ ਲਈ ਲੋੜੀਂਦੇ ਗੁਣਵੱਤਾ ਦੇ ਲੋੜੀਂਦੇ ਪੱਧਰਾਂ ਨੂੰ ਕਾਇਮ ਰੱਖਦੇ ਹੋਏ ਪੈਮਾਨੇ 'ਤੇ 3000 ਘੰਟਿਆਂ ਦਾ ਆਡੀਓ ਡੇਟਾ ਇਕੱਠਾ ਕੀਤਾ। ਹਰੇਕ ਭਾਗੀਦਾਰ ਤੋਂ ਸਪੱਸ਼ਟ ਸਹਿਮਤੀ ਫਾਰਮ ਲਿਆ ਗਿਆ ਸੀ।

1. ਡਾਟਾ ਇਕੱਠਾ ਕਰਨ

2. ਡੇਟਾ ਸੈਗਮੈਂਟੇਸ਼ਨ

  • ਇਕੱਤਰ ਕੀਤੇ ਗਏ ਆਡੀਓ ਡੇਟਾ ਨੂੰ 15 ਸਕਿੰਟਾਂ ਦੇ ਭਾਸ਼ਣ ਹਿੱਸਿਆਂ ਵਿੱਚ ਵੰਡਿਆ ਗਿਆ ਸੀ ਅਤੇ ਹਰੇਕ ਦਿੱਤੇ ਗਏ ਬੁਲਾਰੇ, ਆਵਾਜ਼ ਦੀ ਕਿਸਮ, ਮੋੜ, ਵਾਕਾਂਸ਼ ਅਤੇ ਗੱਲਬਾਤ ਵਿੱਚ ਵਾਕਾਂਸ਼ਾਂ ਲਈ ਮਿਲੀਸਕਿੰਟਾਂ ਤੱਕ ਟਾਈਮਸਟੈਂਪ ਕੀਤਾ ਗਿਆ ਸੀ।
  • ਇੱਕ ਧੁਨੀ ਸਿਗਨਲ ਦੇ ਸ਼ੁਰੂ ਅਤੇ ਅੰਤ ਵਿੱਚ 200-400 ਮਿਲੀਸਕਿੰਟ ਪੈਡਿੰਗ ਦੇ ਨਾਲ ਇਸਦੇ ਨਿਸ਼ਾਨਾ ਧੁਨੀ ਸਿਗਨਲ ਲਈ ਹਰੇਕ ਹਿੱਸੇ ਨੂੰ ਬਣਾਇਆ ਗਿਆ।
  • ਸਾਰੇ ਹਿੱਸਿਆਂ ਲਈ, ਹੇਠ ਲਿਖੀਆਂ ਵਸਤੂਆਂ ਮੌਜੂਦ ਸਨ ਅਤੇ ਭਰੀਆਂ ਗਈਆਂ ਸਨ ਜਿਵੇਂ ਕਿ, ਸ਼ੁਰੂਆਤੀ ਸਮਾਂ, ਸਮਾਪਤੀ ਸਮਾਂ, ਖੰਡ ਆਈਡੀ, ਉੱਚੀ ਆਵਾਜ਼ ਦਾ ਪੱਧਰ (ਉੱਚੀ, ਆਮ, ਸ਼ਾਂਤ), ਪ੍ਰਾਇਮਰੀ ਧੁਨੀ ਦੀ ਕਿਸਮ (ਬੋਲੀ, ਬੱਬਲ, ਸੰਗੀਤ, ਸ਼ੋਰ, ਓਵਰਲੈਪ), ਭਾਸ਼ਾ ਕੋਡ ਸਪੀਕਰ। ਆਈਡੀ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਆਦਿ

3. ਗੁਣਵੱਤਾ ਜਾਂਚ ਅਤੇ ਫੀਡਬੈਕ

  • ਸਾਰੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਦਾ ਮੁਲਾਂਕਣ ਗੁਣਵੱਤਾ ਲਈ ਕੀਤਾ ਗਿਆ ਸੀ ਅਤੇ ਸਿਰਫ 90% ਦੇ WER ਅਤੇ 90% ਦੀ TER ਨਾਲ ਪ੍ਰਮਾਣਿਤ ਭਾਸ਼ਣ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਪ੍ਰਦਾਨ ਕੀਤਾ ਗਿਆ ਸੀ
  • ਕੁਆਲਿਟੀ ਚੈੱਕਲਿਸਟ ਦਾ ਅਨੁਸਰਣ ਕੀਤਾ ਗਿਆ:
    » ਖੰਡ ਦੀ ਲੰਬਾਈ ਦੇ ਅਧਿਕਤਮ 15 ਸਕਿੰਟ
    »ਵਿਸ਼ੇਸ਼ ਡੋਮੇਨਾਂ ਤੋਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਅਰਥਾਤ: ਮੌਸਮ, ਵੱਖ-ਵੱਖ ਕਿਸਮਾਂ ਦੀਆਂ ਖ਼ਬਰਾਂ, ਸਿਹਤ, ਖੇਤੀਬਾੜੀ, ਸਿੱਖਿਆ, ਨੌਕਰੀਆਂ ਜਾਂ ਵਿੱਤ
    » ਘੱਟ ਬੈਕਗ੍ਰਾਊਂਡ ਸ਼ੋਰ
    »ਕੋਈ ਆਡੀਓ ਕਲਿੱਪ ਬੰਦ ਨਹੀਂ - ਕੋਈ ਵਿਗਾੜ ਨਹੀਂ
    » ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਲਈ ਸਹੀ ਆਡੀਓ ਸੈਗਮੈਂਟੇਸ਼ਨ

4. ਡਾਟਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ

ਹਿਚਕਿਚਾਹਟ, ਭਰਨ ਵਾਲੇ ਸ਼ਬਦ, ਗਲਤ ਸ਼ੁਰੂਆਤ, ਅਤੇ ਹੋਰ ਮੌਖਿਕ ਟਿਕਸ ਸਮੇਤ, ਸਾਰੇ ਬੋਲੇ ​​ਗਏ ਸ਼ਬਦਾਂ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਵਿੱਚ ਸਹੀ ਢੰਗ ਨਾਲ ਕੈਪਚਰ ਕੀਤਾ ਗਿਆ ਸੀ। ਅਸੀਂ ਵੱਡੇ ਅਤੇ ਛੋਟੇ ਅੱਖਰਾਂ, ਸਪੈਲਿੰਗ, ਵੱਡੇ ਅੱਖਰ, ਸੰਖੇਪ, ਸੰਕੁਚਨ, ਸੰਖਿਆਵਾਂ,
ਵਿਰਾਮ ਚਿੰਨ੍ਹ, ਸੰਖੇਪ ਸ਼ਬਦ, ਅਸਪਸ਼ਟ ਭਾਸ਼ਣ, ਗੈਰ-ਸਪੀਚ ਸ਼ੋਰ ਆਦਿ।

ਨਤੀਜਾ

ਮਾਹਰ ਭਾਸ਼ਾ ਵਿਗਿਆਨੀਆਂ ਦਾ ਉੱਚ-ਗੁਣਵੱਤਾ ਆਡੀਓ ਡੇਟਾ ਇੰਡੀਅਨ ਇੰਸਟੀਚਿਊਟ ਆਫ ਟੈਕਨਾਲੋਜੀ - ਮਦਰਾਸ ਨੂੰ ਨਿਰਧਾਰਤ ਸਮੇਂ ਵਿੱਚ ਵੱਖ-ਵੱਖ ਉਪਭਾਸ਼ਾਵਾਂ ਵਾਲੀਆਂ 8 ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਬਹੁ-ਭਾਸ਼ਾਈ ਭਾਸ਼ਣ ਪਛਾਣ ਮਾਡਲਾਂ ਨੂੰ ਸਹੀ ਢੰਗ ਨਾਲ ਸਿਖਲਾਈ ਅਤੇ ਬਣਾਉਣ ਵਿੱਚ ਸਮਰੱਥ ਕਰੇਗਾ। ਸਪੀਚ ਮਾਨਤਾ ਮਾਡਲਾਂ ਨੂੰ ਇਹਨਾਂ ਲਈ ਵਰਤਿਆ ਜਾ ਸਕਦਾ ਹੈ:

  • ਨਾਗਰਿਕਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀ ਆਪਣੀ ਮਾਤ ਭਾਸ਼ਾ ਵਿੱਚ ਪਹਿਲਕਦਮੀਆਂ ਨਾਲ ਜੋੜ ਕੇ ਡਿਜੀਟਲ ਸ਼ਮੂਲੀਅਤ ਲਈ ਭਾਸ਼ਾ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਦੂਰ ਕਰੋ।
  • ਡਿਜੀਟਲ ਗਵਰਨੈਂਸ ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਦਾ ਹੈ
  • ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਸੇਵਾਵਾਂ ਅਤੇ ਉਤਪਾਦਾਂ ਲਈ ਇੱਕ ਈਕੋਸਿਸਟਮ ਬਣਾਉਣ ਲਈ ਉਤਪ੍ਰੇਰਕ
  • ਜਨਤਕ ਹਿੱਤਾਂ, ਖਾਸ ਕਰਕੇ, ਸ਼ਾਸਨ ਅਤੇ ਨੀਤੀ ਦੇ ਖੇਤਰਾਂ ਵਿੱਚ ਵਧੇਰੇ ਸਥਾਨਿਕ ਡਿਜੀਟਲ ਸਮੱਗਰੀ
ਹਵਾਲਾ ਪ੍ਰਤੀਕ

ਅਸੀਂ ਗੱਲਬਾਤ ਦੇ ਏਆਈ ਸਪੇਸ ਵਿੱਚ ਸ਼ੈਪ ਦੀ ਮੁਹਾਰਤ ਤੋਂ ਪ੍ਰਭਾਵਿਤ ਹੋਏ। ਸਖ਼ਤ ਸਮਾਂ-ਸੀਮਾਵਾਂ ਅਤੇ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ਾਂ ਦੇ ਅੰਦਰ 8 ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਮਾਹਰ ਭਾਸ਼ਾ ਵਿਗਿਆਨੀਆਂ ਤੋਂ ਲੋੜੀਂਦੇ ਸਿਖਲਾਈ ਡੇਟਾ ਨੂੰ ਸੋਰਸਿੰਗ, ਸੈਗਮੈਂਟਿੰਗ, ਟ੍ਰਾਂਸਕ੍ਰਾਈਬਿੰਗ ਅਤੇ ਡਿਲੀਵਰ ਕਰਨ ਵਿੱਚ ਉਨ੍ਹਾਂ ਦੀ ਸਮੁੱਚੀ ਪ੍ਰੋਜੈਕਟ ਐਗਜ਼ੀਕਿਊਸ਼ਨ ਯੋਗਤਾ; ਜਦੋਂ ਕਿ ਗੁਣਵੱਤਾ ਦੇ ਸਵੀਕਾਰਯੋਗ ਮਿਆਰ ਨੂੰ ਬਣਾਈ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ।

★★★★★
ਹਵਾਲਾ ਪ੍ਰਤੀਕ

ਸਾਨੂੰ ਦੱਸੋ ਕਿ ਅਸੀਂ ਤੁਹਾਡੀ ਅਗਲੀ AI ਪਹਿਲ ਵਿੱਚ ਕਿਵੇਂ ਮਦਦ ਕਰ ਸਕਦੇ ਹਾਂ.