ਭਾਰਤ ਵਰਗੇ ਸੱਭਿਆਚਾਰਕ ਤੌਰ 'ਤੇ ਵਿਭਿੰਨ ਅਤੇ ਭਾਸ਼ਾਈ ਤੌਰ 'ਤੇ ਅਮੀਰ ਦੇਸ਼ ਵਿੱਚ, ਸਮਾਵੇਸ਼ੀ AI ਦਾ ਨਿਰਮਾਣ ਪ੍ਰਤੀਨਿਧੀ, ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲੇ ਡੇਟਾਸੈੱਟ ਇਕੱਠੇ ਕਰਨ ਨਾਲ ਸ਼ੁਰੂ ਹੁੰਦਾ ਹੈ। ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਦੇ ਪਿੱਛੇ ਇਹੀ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਹੈ - ARTPARK , IISc ਬੰਗਲੁਰੂ , ਅਤੇ Google ਦੀ ਅਗਵਾਈ ਵਿੱਚ ਇੱਕ ਵੱਡੇ ਪੱਧਰ 'ਤੇ, ਓਪਨ-ਸੋਰਸ ਪਹਿਲਕਦਮੀ , ਜਿਸਦਾ ਉਦੇਸ਼ ਹਰ ਭਾਰਤੀ ਭਾਸ਼ਾ ਅਤੇ ਉਪਭਾਸ਼ਾ ਨੂੰ ਆਵਾਜ਼ ਦੇਣਾ ਹੈ।
ਕੀ ਮਹੱਤਵਾਕਾਂਖੀ ਟੀਚਾ ਹੈ? ਭਾਰਤ ਦੇ 773 ਜ਼ਿਲ੍ਹਿਆਂ ਦੇ 1 ਲੱਖ ਲੋਕਾਂ ਤੋਂ 150,000+ ਘੰਟੇ ਭਾਸ਼ਣ ਅਤੇ 15,000+ ਘੰਟੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਇਕੱਠੇ ਕਰਨਾ ।
ਇਸ ਰਾਸ਼ਟਰੀ ਮਿਸ਼ਨ ਦੇ ਮੁੱਖ ਵਿਕਰੇਤਾਵਾਂ ਵਿੱਚੋਂ ਇੱਕ ਹੋਣ ਦੇ ਨਾਤੇ, ਸ਼ੈਪ ਨੇ ਸਵੈ-ਚਾਲਿਤ ਭਾਸ਼ਣ ਡੇਟਾ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ, ਅਤੇ ਮੈਟਾਡੇਟਾ ਸੰਗ੍ਰਹਿ ਨੂੰ ਤਿਆਰ ਕਰਨ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ ਭੂਮਿਕਾ ਨਿਭਾਈ - ਇੱਕਸਾਰ ਆਵਾਜ਼ ਤਕਨਾਲੋਜੀਆਂ ਲਈ ਨੀਂਹ ਰੱਖੀ ਜੋ ਅਸਲ ਭਾਰਤ ਨੂੰ ਸੱਚਮੁੱਚ ਦਰਸਾਉਂਦੀਆਂ ਹਨ।
ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਦੇ ਪਿੱਛੇ ਦਾ ਵਿਜ਼ਨ
ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਭਾਰਤ ਵਿੱਚ ਸਭ ਤੋਂ ਵੱਡਾ ਮਲਟੀਮੋਡਲ, ਬਹੁ-ਭਾਸ਼ਾਈ, ਓਪਨ-ਸੋਰਸ ਡੇਟਾਸੈਟ ਬਣਾ ਕੇ ਏਆਈ ਸਮਾਵੇਸ਼ ਪਾੜੇ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਤਿਆਰ ਕੀਤਾ ਗਿਆ ਹੈ । ਇਹ ਡੇਟਾ ਮੂਲ ਭਾਰਤੀ ਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਸਹੀ ਬੋਲੀ ਪਛਾਣ, ਅਨੁਵਾਦ ਅਤੇ ਜਨਰੇਟਿਵ ਏਆਈ ਪ੍ਰਣਾਲੀਆਂ ਨੂੰ ਵਿਕਸਤ ਕਰਨ ਲਈ ਬੁਨਿਆਦੀ ਹੈ - ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਬਹੁਤ ਸਾਰੀਆਂ ਗਲੋਬਲ ਤਕਨੀਕੀ ਈਕੋਸਿਸਟਮ ਵਿੱਚ ਘੱਟ ਪ੍ਰਤੀਨਿਧਤਾ ਪ੍ਰਾਪਤ ਹਨ।
ਲੰਬੇ ਸਮੇਂ ਦਾ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਇਹਨਾਂ ਵਿੱਚ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਐਪਲੀਕੇਸ਼ਨਾਂ ਨੂੰ ਸ਼ਕਤੀ ਪ੍ਰਦਾਨ ਕਰਨਾ ਹੈ:
- ਸਿਹਤ ਸੰਭਾਲ - ਆਵਾਜ਼-ਅਧਾਰਤ ਟੈਲੀਮੈਡੀਸਨ
- ਸਿੱਖਿਆ - ਭਾਸ਼ਾਈ ਸਿੱਖਿਆ ਪਲੇਟਫਾਰਮ
- ਪ੍ਰਸ਼ਾਸਨ - ਨਾਗਰਿਕ ਸੇਵਾਵਾਂ ਲਈ ਗੱਲਬਾਤ ਇੰਟਰਫੇਸ
- ਅਸੈੱਸਬਿਲਟੀ - ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਅਪਾਹਜ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਵੌਇਸ ਟੂਲ
- ਆਫ਼ਤ ਪ੍ਰਤੀਕਿਰਿਆ - ਸਥਾਨਕ ਉਪਭਾਸ਼ਾਵਾਂ ਵਿੱਚ ਅਸਲ-ਸਮੇਂ ਦਾ ਸੰਚਾਰ
ਸ਼ੈਇਪ ਨੇ ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਲਈ ਭਾਰਤ ਦਾ ਸਭ ਤੋਂ ਵੱਡਾ ਓਪਨ-ਸੋਰਸ ਸਪੀਚ ਡੇਟਾਸੈੱਟ ਬਣਾਉਣ ਵਿੱਚ ਕਿਵੇਂ ਮਦਦ ਕੀਤੀ
ਸ਼ੈਪ ਨੂੰ 8,000 ਘੰਟੇ ਦੇ ਸਵੈ-ਚਾਲਿਤ ਭਾਸ਼ਣ ਅਤੇ 800 ਘੰਟੇ ਦੇ ਹੱਥੀਂ ਪ੍ਰਮਾਣਿਤ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨਾਂ ਦੇ ਸੰਗ੍ਰਹਿ ਦੀ ਜ਼ਿੰਮੇਵਾਰੀ ਸੌਂਪੀ ਗਈ ਸੀ । ਸਾਡੀ ਜ਼ਿੰਮੇਵਾਰੀ ਸਪੀਕਰ ਆਨਬੋਰਡਿੰਗ, ਆਡੀਓ ਕੈਪਚਰ, ਮੈਟਾਡੇਟਾ ਟੈਗਿੰਗ, ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਤਾਲਮੇਲ ਅਤੇ ਗੁਣਵੱਤਾ ਨਿਯੰਤਰਣ ਤੱਕ ਸੀ।
8,000 ਘੰਟੇ ਦਾ ਸਵੈਚਾਲਿਤ ਆਡੀਓ ਡੇਟਾ
ਪ੍ਰਤੀ ਜ਼ਿਲ੍ਹਾ 400+ ਮੂਲ ਬੁਲਾਰਿਆਂ ਦੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ , ਜੋ ਵਿਭਿੰਨ ਉਮਰ ਸਮੂਹਾਂ, ਲਿੰਗਾਂ ਅਤੇ ਉਪਭਾਸ਼ਾਵਾਂ ਨੂੰ ਦਰਸਾਉਂਦੀਆਂ ਹਨ।
80 ਜ਼ਿਲ੍ਹੇ, ਕਵਰ ਕੀਤੇ ਗਏ
ਕੁਦਰਤੀ, ਪ੍ਰਸੰਗਿਕ ਭਾਸ਼ਣ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਚਿੱਤਰ-ਅਧਾਰਤ ਪ੍ਰੇਰਕ
ਇੱਥੇ ਸਾਡੇ ਪਹੁੰਚ ਨੂੰ ਵਿਲੱਖਣ ਬਣਾਉਣ ਵਾਲੀਆਂ ਗੱਲਾਂ ਹਨ:
ਜ਼ਿਲ੍ਹਾ-ਪੱਧਰੀ ਵਿਭਿੰਨਤਾ
ਅਸੀਂ ਬਿਹਾਰ, ਉੱਤਰ ਪ੍ਰਦੇਸ਼, ਕਰਨਾਟਕ, ਪੱਛਮੀ ਬੰਗਾਲ ਅਤੇ ਮਹਾਰਾਸ਼ਟਰ ਵਰਗੇ ਰਾਜਾਂ ਵਿੱਚ ਫੈਲੇ 80 ਜ਼ਿਲ੍ਹਿਆਂ ਤੋਂ ਰਿਕਾਰਡਿੰਗਾਂ ਪ੍ਰਾਪਤ ਕੀਤੀਆਂ। ਹਰੇਕ ਜ਼ਿਲ੍ਹੇ ਨੇ ਖੇਤਰੀ ਸੰਤੁਲਨ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ 100 ਘੰਟੇ ਦਾ ਆਡੀਓ ਡੇਟਾ ਯੋਗਦਾਨ ਪਾਇਆ। ਅਸੀਂ ਮੂਲ ਬੁਲਾਰਿਆਂ ਨੂੰ ਸ਼ਾਮਲ ਕੀਤਾ, ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ ਕਿ ਮੁੱਖ ਧਾਰਾ ਦੇ AI ਡੇਟਾਸੈੱਟਾਂ ਵਿੱਚ ਅਕਸਰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤੇ ਜਾਂਦੇ ਖੇਤਰੀ ਲਹਿਜ਼ੇ ਅਤੇ ਉਪਭਾਸ਼ਾਵਾਂ ਦੀ ਨੁਮਾਇੰਦਗੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
ਭਾਸ਼ਾਈ ਅਤੇ ਜਨਸੰਖਿਆ ਪ੍ਰਤੀਨਿਧਤਾ
ਅਸੀਂ ਬਿਹਾਰ, ਉੱਤਰ ਪ੍ਰਦੇਸ਼, ਕਰਨਾਟਕ, ਪੱਛਮੀ ਬੰਗਾਲ ਅਤੇ ਮਹਾਰਾਸ਼ਟਰ ਵਰਗੇ ਰਾਜਾਂ ਵਿੱਚ ਫੈਲੇ 80 ਜ਼ਿਲ੍ਹਿਆਂ ਤੋਂ ਰਿਕਾਰਡਿੰਗਾਂ ਪ੍ਰਾਪਤ ਕੀਤੀਆਂ। ਹਰੇਕ ਜ਼ਿਲ੍ਹੇ ਨੇ ਖੇਤਰੀ ਸੰਤੁਲਨ ਨੂੰ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ 100 ਘੰਟੇ ਦਾ ਆਡੀਓ ਡੇਟਾ ਯੋਗਦਾਨ ਪਾਇਆ। ਅਸੀਂ ਮੂਲ ਬੁਲਾਰਿਆਂ ਨੂੰ ਸ਼ਾਮਲ ਕੀਤਾ, ਇਹ ਯਕੀਨੀ ਬਣਾਉਂਦੇ ਹੋਏ ਕਿ ਮੁੱਖ ਧਾਰਾ ਦੇ AI ਡੇਟਾਸੈੱਟਾਂ ਵਿੱਚ ਅਕਸਰ ਨਜ਼ਰਅੰਦਾਜ਼ ਕੀਤੇ ਜਾਂਦੇ ਖੇਤਰੀ ਲਹਿਜ਼ੇ ਅਤੇ ਉਪਭਾਸ਼ਾਵਾਂ ਦੀ ਨੁਮਾਇੰਦਗੀ ਕੀਤੀ ਜਾਂਦੀ ਹੈ।
ਚਿੱਤਰ-ਪ੍ਰੋਂਪਟਡ ਭਾਸ਼ਣ
ਸਵੈ-ਚਾਲਿਤ ਅਤੇ ਕੁਦਰਤੀ ਸ਼ਬਦਾਵਲੀ ਨੂੰ ਉਤੇਜਿਤ ਕਰਨ ਲਈ, ਭਾਗੀਦਾਰਾਂ ਨੂੰ ਪ੍ਰਤੀ ਸੈਸ਼ਨ 45-90 ਤਸਵੀਰਾਂ ਦਿਖਾਈਆਂ ਗਈਆਂ ਅਤੇ ਉਨ੍ਹਾਂ ਦਾ ਵਰਣਨ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ। ਭਾਗੀਦਾਰਾਂ ਨੂੰ ਉਨ੍ਹਾਂ ਦੀ ਮੂਲ ਭਾਸ਼ਾ ਵਿੱਚ ਕੁਦਰਤੀ, ਸਵੈ-ਚਾਲਿਤ ਪ੍ਰਤੀਕਿਰਿਆਵਾਂ ਪੈਦਾ ਕਰਨ ਲਈ - ਸੱਭਿਆਚਾਰਕ ਪ੍ਰਤੀਕਾਂ ਤੋਂ ਲੈ ਕੇ ਰੋਜ਼ਾਨਾ ਵਸਤੂਆਂ ਤੱਕ - ਵਿਭਿੰਨ ਤਸਵੀਰਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਲਈ ਕਿਹਾ ਗਿਆ। ਇਸ ਨੇ ਇਹ ਯਕੀਨੀ ਬਣਾਇਆ ਕਿ ਰਿਕਾਰਡਿੰਗਾਂ ਅਸਲ-ਸੰਸਾਰ, ਪ੍ਰਸੰਗਿਕ ਭਾਸ਼ਣ ਨੂੰ ਦਰਸਾਉਂਦੀਆਂ ਹਨ - ਜੋ ਕਿ ਉੱਨਤ NLP ਪ੍ਰਣਾਲੀਆਂ ਦੀ ਸਿਖਲਾਈ ਲਈ ਜ਼ਰੂਰੀ ਹਨ।
ਉੱਚ-ਗੁਣਵੱਤਾ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਮਿਆਰ
ਸਿਰਫ਼ 10% ਭਾਸ਼ਣ ਡੇਟਾ ਨੂੰ ਟ੍ਰਾਂਸਕ੍ਰਾਈਬ ਕੀਤਾ ਗਿਆ ਸੀ—800 ਘੰਟੇ ਦੇ ਬਰਾਬਰ। ਸਥਾਨਕ ਭਾਸ਼ਾ ਵਿਗਿਆਨੀਆਂ ਦੁਆਰਾ ਸਪੀਕਰ ਦੇ 20-50 ਕਿਲੋਮੀਟਰ ਦੇ ਘੇਰੇ ਵਿੱਚ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ ਕੀਤੇ ਗਏ ਸਨ, ਜਿਸ ਨਾਲ ਉਪਭਾਸ਼ਾਵਾਂ ਅਤੇ ਸੂਖਮਤਾਵਾਂ ਨਾਲ ਜਾਣੂਤਾ ਯਕੀਨੀ ਬਣਾਈ ਗਈ ਸੀ। ਇੱਕ ਦੂਜੀ-ਪੱਧਰੀ ਜਾਂਚ ਨੇ <5% ਸ਼ਬਦ ਗਲਤੀ ਦਰ (WER) ਨੂੰ ਯਕੀਨੀ ਬਣਾਇਆ।
ਸਖਤ ਗੁਣਵੱਤਾ ਭਰੋਸਾ
ਆਡੀਓ ਡੇਟਾ ਨੂੰ ਇੱਕ ਉੱਚ ਬਾਰ ਨੂੰ ਪੂਰਾ ਕਰਨਾ ਪਿਆ: ਕੋਈ ਬੈਕਗ੍ਰਾਊਂਡ ਸ਼ੋਰ, ਗੂੰਜ, ਫ਼ੋਨ ਵਾਈਬ੍ਰੇਸ਼ਨ, ਜਾਂ ਵਿਗਾੜ ਨਹੀਂ। ਆਡੀਓ ਨੂੰ ਸ਼ਾਂਤ, ਗੂੰਜ-ਮੁਕਤ ਵਾਤਾਵਰਣ ਵਿੱਚ ਰਿਕਾਰਡ ਕੀਤਾ ਗਿਆ ਸੀ। ਬੋਲਣ ਦੀ ਸਪੱਸ਼ਟਤਾ, ਸ਼ੋਰ ਦੇ ਪੱਧਰ, ਮੈਟਾਡੇਟਾ ਸ਼ੁੱਧਤਾ, ਅਤੇ ਸਪੀਕਰ ਤਸਦੀਕ ਲਈ ਦਿਸ਼ਾ-ਨਿਰਦੇਸ਼ਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨ ਲਈ ਫਾਈਲਾਂ ਦੀ ਸਖ਼ਤ ਸਮੀਖਿਆ ਕੀਤੀ ਗਈ। ਮੈਟਾਡੇਟਾ ਟੈਗਿੰਗ ਸਾਰੀਆਂ ਫਾਈਲਾਂ ਵਿੱਚ ਸਹੀ ਹੋਣੀ ਚਾਹੀਦੀ ਸੀ, ਅਤੇ ਸਾਰੀਆਂ ਰਿਕਾਰਡਿੰਗਾਂ ਨੂੰ ਸਪੀਕਰ ਅਤੇ ਸਥਾਨ ਅਲਾਈਨਮੈਂਟ ਲਈ ਜਾਂਚਿਆ ਗਿਆ ਸੀ।
ਚੁਣੌਤੀਆਂ ਜੋ ਅਸੀਂ ਹੱਲ ਕੀਤੀਆਂ
- ਰਿਮੋਟ ਲੌਜਿਸਟਿਕਸ - 80 ਜ਼ਿਲ੍ਹਿਆਂ ਵਿੱਚ ਟੀਮਾਂ ਦਾ ਪ੍ਰਬੰਧਨ
- ਸਪੀਕਰ ਵਿਭਿੰਨਤਾ - ਦੂਰ-ਦੁਰਾਡੇ ਥਾਵਾਂ 'ਤੇ 32,000+ ਪ੍ਰਮਾਣਿਤ ਸਪੀਕਰਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨਾ
- ਸੱਭਿਆਚਾਰਕ ਸੰਵੇਦਨਸ਼ੀਲਤਾ - ਸਥਾਨਕ ਰੀਤੀ-ਰਿਵਾਜਾਂ ਅਤੇ ਉਪਭਾਸ਼ਾਵਾਂ ਦਾ ਸਤਿਕਾਰ ਕਰਨਾ
- ਡੇਟਾ ਇਕਸਾਰਤਾ - ਗੁਣਵੱਤਾ ਅਤੇ ਪਾਲਣਾ ਦੇ ਮਿਆਰਾਂ ਨੂੰ ਪੂਰਾ ਕਰਨਾ
- ਗੁਣਵੱਤਾ ਕੰਟਰੋਲ - ਕਈ ਭਾਸ਼ਾਈ ਅਤੇ ਸੱਭਿਆਚਾਰਕ ਸੰਦਰਭਾਂ ਵਿੱਚ
ਸਾਡੀ ਸਫਲਤਾ ਬਾਰੀਕੀ ਨਾਲ ਯੋਜਨਾਬੰਦੀ, ਤਕਨਾਲੋਜੀ-ਅਧਾਰਤ ਪ੍ਰਮਾਣਿਕਤਾ, ਅਤੇ ਹਰੇਕ ਖੇਤਰ ਦੀਆਂ ਸੱਭਿਆਚਾਰਕ ਬਾਰੀਕੀਆਂ ਨੂੰ ਸਮਝਣ ਵਾਲੀਆਂ ਸਥਾਨਕ ਟੀਮਾਂ ਨਾਲ ਸਾਂਝੇਦਾਰੀ ਦੇ ਨਤੀਜੇ ਵਜੋਂ ਆਈ।
ਪ੍ਰਭਾਵ ਅਤੇ ਐਪਲੀਕੇਸ਼ਨ
ਸ਼ੈਪ ਦੇ ਯੋਗਦਾਨ ਨੇ ਨਾ ਸਿਰਫ ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਦੀ ਪ੍ਰਗਤੀ ਨੂੰ ਤੇਜ਼ ਕੀਤਾ ਹੈ ਬਲਕਿ ਭਾਰਤ ਵਿੱਚ ਸਮਾਵੇਸ਼ੀ AI ਦੀ ਨੀਂਹ ਵੀ ਰੱਖੀ ਹੈ। ਕਿਉਰੇਟਿਡ ਸਪੀਚ ਡੇਟਾਸੈਟ ਪਹਿਲਾਂ ਹੀ AI ਮਾਡਲਾਂ ਨੂੰ ਬਣਾਉਣ ਅਤੇ ਸੁਧਾਰਨ ਲਈ ਵਰਤਿਆ ਜਾ ਰਿਹਾ ਹੈ:
- ਭਾਸ਼ਾਈ ਆਵਾਜ਼ ਸਹਾਇਕ
- ਖੇਤਰੀ ਅਨੁਵਾਦ ਇੰਜਣ
- ਨੇਤਰਹੀਣਾਂ ਲਈ ਪਹੁੰਚਯੋਗ ਸੰਚਾਰ ਸਾਧਨ
- ਪੇਂਡੂ ਵਿਦਿਆਰਥੀਆਂ ਲਈ ਏਆਈ-ਸੰਚਾਲਿਤ ਐਡਟੈਕ ਪਲੇਟਫਾਰਮ
- ਪੇਂਡੂ ਟੈਲੀਮੈਡੀਸਨ
- ਆਵਾਜ਼-ਅਧਾਰਤ ਨਾਗਰਿਕ ਸੇਵਾਵਾਂ
- ਰੀਅਲ-ਟਾਈਮ ਅਨੁਵਾਦ ਅਤੇ ਟ੍ਰਾਂਸਕ੍ਰਿਪਸ਼ਨ
ਸਿੱਟਾ
ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ ਸਮਾਵੇਸ਼ੀ, ਪਹੁੰਚਯੋਗ AI ਵੱਲ ਇੱਕ ਦਲੇਰਾਨਾ ਕਦਮ ਹੈ—ਅਤੇ ਸ਼ੈਪ ਨੂੰ ਇੱਕ ਬੁਨਿਆਦੀ ਭੂਮਿਕਾ ਨਿਭਾਉਣ ਦਾ ਮਾਣ ਪ੍ਰਾਪਤ ਹੈ। ਸ਼ੈਪ ਦਾ ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ 'ਤੇ ਕੰਮ ਵਿਭਿੰਨਤਾ ਅਤੇ ਪ੍ਰਤੀਨਿਧਤਾ ਵਿੱਚ ਜੜ੍ਹਾਂ ਵਾਲੇ ਨੈਤਿਕ, ਸਮਾਵੇਸ਼ੀ AI ਪ੍ਰਣਾਲੀਆਂ ਦੇ ਨਿਰਮਾਣ ਪ੍ਰਤੀ ਸਾਡੀ ਵਚਨਬੱਧਤਾ ਦੀ ਪੁਸ਼ਟੀ ਕਰਦਾ ਹੈ। 8,000 ਘੰਟਿਆਂ ਤੋਂ ਵੱਧ ਭਾਸ਼ਣ ਇਕੱਠੇ ਕੀਤੇ ਜਾਣ ਅਤੇ 800 ਘੰਟਿਆਂ ਦੀ ਪ੍ਰਤੀਲਿਪੀ ਦੇ ਨਾਲ, ਸਾਨੂੰ ਭਾਰਤ ਦੇ ਸਭ ਤੋਂ ਦੂਰਦਰਸ਼ੀ ਡਿਜੀਟਲ ਸਮਾਵੇਸ਼ ਪ੍ਰੋਜੈਕਟਾਂ ਵਿੱਚੋਂ ਇੱਕ ਵਿੱਚ ਭੂਮਿਕਾ ਨਿਭਾਉਣ 'ਤੇ ਮਾਣ ਹੈ।
ਜਿਵੇਂ ਕਿ ਪ੍ਰੋਜੈਕਟ ਵਾਣੀ 150,000+ ਘੰਟਿਆਂ ਦੇ ਡੇਟਾ ਦੇ ਆਪਣੇ ਵੱਡੇ ਟੀਚੇ ਵੱਲ ਵਧਦਾ ਜਾ ਰਿਹਾ ਹੈ, ਅਸੀਂ ਏਆਈ ਨਵੀਨਤਾ ਦੇ ਅਗਲੇ ਮੋਰਚੇ ਦਾ ਸਮਰਥਨ ਕਰਨ ਲਈ ਤਿਆਰ ਹਾਂ ਜੋ ਹਰ ਭਾਰਤੀ ਲਈ - ਅਤੇ - ਲਈ ਬੋਲਦਾ ਹੈ।
ਕੀ ਤੁਸੀਂ ਸਾਡੇ ਨਾਲ ਸਾਂਝੇਦਾਰੀ ਕਰਕੇ ਅਸਲ ਦੁਨੀਆਂ ਨੂੰ ਸਮਝਣ ਵਾਲੀ ਏਆਈ ਬਣਾਉਣਾ ਚਾਹੁੰਦੇ ਹੋ? www.shaip.com