مشین لرننگ الگورتھم (2) کا استعمال کرتے ہوئے سپیچ سگنلز سے فیچر پیرامیٹر نکالنا بہتر

May 30, 2023

3.7 ڈیٹا سیٹ ڈیٹاسیٹ جمع کرنے اور جنریشن کے عمل کو اس طرح انجام دیا گیا۔ اس مطالعے میں، 120 گھنٹے آڈیو والا ڈیٹاسیٹ ماڈل ٹریننگ کے لیے استعمال کیا گیا تھا۔ ڈیٹاسیٹ میں تقریر کی آڈیو ریکارڈنگز شامل ہیں جو تقریباً 120 گھنٹے کی کل لمبائی کے ساتھ زیادہ سے زیادہ 15 الفاظ کے جملوں پر مشتمل ہوتی ہیں۔

Desert living cistanche

صحرائی ginseng

اس کے علاوہ، ڈیٹاسیٹ میں زبان کے ماڈل کو تیار کرنے میں استعمال کے لیے مختلف متن کی ایک بڑی مقدار شامل ہے۔ 90,650 سے زیادہ کلمات، 415,780 الفاظ، اور 65,810 منفرد الفاظ جو ٹیکسٹ کارپس میں شامل تھے، جمع کیے گئے، جس کے نتیجے میں تقریباً 120 گھنٹے نقل شدہ تقریر کا ڈیٹا ہوا۔ ہم ڈیٹاسیٹ کو تربیت، توثیق اور ٹیسٹ سیٹس میں تقسیم کرتے ہیں۔ ڈیٹاسیٹ کے اعدادوشمار

ٹیبل 3 میں اطلاع دی گئی ہے۔

جدول 3۔ ڈیٹا سیٹ کی تفصیلات۔

Table 3. The dataset specifications.

ہم نے ڈیٹاسیٹ کو تربیت، توثیق اور ٹیسٹ سیٹ کے مطابق تین فولڈرز میں تقسیم کیا۔ ہر فولڈر میں آڈیو ریکارڈنگز اور ٹرانسکرپٹس ہوتے ہیں۔ آڈیو اور متعلقہ ٹرانسکرپشن فائل کے نام ایک جیسے ہیں، سوائے اس کے کہ آڈیو ریکارڈنگز کو WAV فائلوں کے طور پر اسٹور کیا جاتا ہے، جب کہ ٹرانسکرپشنز کو UTF-8 انکوڈنگ کا استعمال کرتے ہوئے TXT فائلوں کے طور پر اسٹور کیا جاتا ہے۔ تمام ٹرانسکرپشنز کو لاطینی حروف تہجی کا استعمال کرتے ہوئے دکھایا گیا ہے جس میں 29 حروف اور apostrophe علامت ہے۔ اوور فٹنگ کو روکنے کے لیے، ہم نے رفتار کی گڑبڑ اور سپیکٹرل اضافہ پر مبنی ڈیٹا بڑھانے کی تکنیکوں کا اطلاق کیا۔

Cistanche deserticola slice (11)

Cistanche deserticola

4. مجوزہ طریقہ

اسپیچ ریکگنیشن سسٹم تیار کرتے وقت پروگرامرز کے لیے ایک اہم کام اسپیچ سگنلز کے پیرامیٹرک اظہار کے لیے ایک بہترین طریقہ کی تخلیق ہے [45]۔ یہ طریقہ آوازوں اور بولے جانے والے الفاظ کی بہترین علیحدگی کے قابل بناتا ہے جبکہ اس بات کو یقینی بناتا ہے کہ بولنے والے تلفظ کے نمونوں اور صوتی ماحول میں ہونے والی تبدیلیوں کے لیے غیر حساس ہیں۔ الفاظ کی شناخت میں زیادہ تر غلطیاں مائیکروفون میں تبدیلی یا تلفظ کی پچ میں فرق کی وجہ سے سگنل کی پچ میں تبدیلی کی وجہ سے ہوتی ہیں [46]۔ غلطیوں کی ایک اور عام وجہ سپیکٹرم کی شکل کی بے ترتیب غیر لکیری خرابی ہے، جو ہمیشہ اسپیکر کے اسپیچ سگنل میں موجود ہوتی ہیں [47,48]۔ لہٰذا، تقریر کی شناخت کے موثر نظام بنانے میں سب سے اہم کاموں میں سے ایک ایسی نمائندگی کا انتخاب ہے جو تجزیہ کردہ سگنل کے مواد کے لیے کافی ہو اور ساتھ ہی اسپیکر کی آوازوں اور مختلف صوتی ماحول کے لیے بھی غیر حساس ہو۔

Cistanche supplement near me—Improve memory2

میرے نزدیک Cistanche ضمیمہ - یادداشت کو بہتر بنانے والا

خصوصیت کے پیرامیٹرز کو نکالنے کے لیے استعمال ہونے والے نظام میں عام طور پر درج ذیل تقاضے ہوتے ہیں۔ معلوماتی مواد، یعنی خصوصیت کے پیرامیٹرز کا مجموعہ، قابلِ شناخت تقریری عناصر کی قابل اعتماد شناخت کو یقینی بنائے۔ مزید برآں، بلند آواز، یعنی آڈیو سگنل کی زیادہ سے زیادہ کمپریشن، اور پیرامیٹرز کے غیر شماریاتی ارتباط کو کم سے کم کیا جانا چاہیے۔ اسپیکر سے آزادی بھی حاصل کی جانی چاہیے، یعنی کرداروں کے ویکٹر سے اسپیکر کی خصوصیات سے متعلق معلومات کو زیادہ سے زیادہ ہٹانا۔ آخر میں، یکسانیت، جس سے مراد وہ پیرامیٹرز ہیں جن میں یکساں اوسط فرق ہے اور کریکٹر سیٹ کے درمیان وابستگی کا تعین کرنے کے لیے سادہ میٹرکس استعمال کرنے کی صلاحیت، فراہم کی جانی چاہیے [49]۔ تاہم، بیک وقت تمام تقاضوں کو پورا کرنا ہمیشہ ممکن نہیں ہوتا کیونکہ اس طرح کے تقاضے متضاد ہوتے ہیں۔ تقریر کے عناصر کی پیرامیٹرک تفصیل کافی تفصیلی ہونی چاہیے تاکہ ان کو قابل اعتماد طریقے سے ممتاز کیا جا سکے اور جتنا ممکن ہو سکے مختصر ہونا چاہیے۔

Desert living cistanche

سپرمین جڑی بوٹیاں cistanche

عملی طور پر، مائیکروفون سے موصول ہونے والے اسپیچ سگنل کو 8 سے 22 کلو ہرٹز کے نمونے لینے کی شرح پر ڈیجیٹائز کیا جاتا ہے۔ سیریل عددی اقدار کو تقریر کے ٹکڑوں (فریمز) میں 10 سے 30 ms کی مدت کے ساتھ تقسیم کیا جاتا ہے، جو کہ نیم اسٹیشنری اسپیچ حصوں کے مساوی ہے۔ خصوصیات کا ایک ویکٹر ہر فریم سے شمار کیا جاتا ہے، جو بعد میں اسپیچ ریکگنیشن کی صوتی سطح پر استعمال ہوتا ہے۔ فی الحال، خودکار تعلق کے تجزیہ، ہارڈویئر لکیری فلٹرنگ، اسپیکٹرل تجزیہ، اور LPC پر مبنی سگنلز کی پیرامیٹرک نمائندگی کے لیے طریقوں کی ایک وسیع رینج دستیاب ہے۔ اسپیچ پیرامیٹرائزیشن کا سب سے عام طریقہ سگنل کے ٹکڑوں کا سپیکٹرل تجزیہ اور ان کے سیپسٹرل کوفیشینٹس کا حساب کتاب ہے۔

ایم ایف سی سی کو اسپیچ سگنل [41] کے لیے معلوماتی خصوصیات کے طور پر استعمال کیا گیا ہے۔ یہ خصوصیات تقریر کی شناخت میں بڑے پیمانے پر استعمال ہوتی ہیں اور دو اہم تصورات پر مبنی ہیں: سیپسٹل اور میل اسکیلز۔ الگورتھم کے اہم فوائد اس کی اعلیٰ سطح کی واقفیت اور بولنے میں آسانی ہے۔ ایم ایف سی سی کی خصوصیات ریکارڈ شدہ اسپیچ سگنلز سے الگ ہیں۔ MFCC الگورتھم فونوگرام اور سپیکٹرم سوئچنگ الگورتھم کے نتائج استعمال کرتا ہے۔ کلاسیکی الگورتھم جو MFCCs کا حساب لگانے کے لیے استعمال ہوتا ہے اسے شکل 5 میں دکھایا گیا ہے۔

Figure 5. Classical scheme for calculating MFCCs.

شکل 5. MFCCs کا حساب لگانے کے لیے کلاسیکی اسکیم۔

یہ مطالعہ اسپیچ سگنل سے فنکشن پیرامیٹرز کو نکالنے کا ایک تیز طریقہ پیش کرتا ہے۔ MFCCs کے تیز رفتار حساب کے لیے مجوزہ الگورتھم کو شکل 6 میں دکھایا گیا ہے۔

Figure 6. Proposed framework for calculating MFCCs.

شکل 6. MFCCs کا حساب لگانے کے لیے مجوزہ فریم ورک۔

ہم سپیچ سگنل سے فنکشن کے پیرامیٹرز کو تیزی سے نکالنے کے لیے مجوزہ الگورتھم کے عمل کی ترتیب پر غور کرتے ہیں۔

4.1 فریموں میں تقسیم

ابتدائی فلٹرنگ کے بعد، اسپیچ سگنل کو 16 ایم ایس فریموں میں تقسیم کیا گیا ہے۔ ہر فریم (پہلے کے علاوہ) پچھلے فریم کے آخری 10 ایم ایس پر مشتمل ہے۔ یہ عمل سگنل کے اختتام تک جاری رہتا ہے۔ اس مطالعہ میں، کیونکہ اسپیچ سگنل کی نمونے کی شرح 16 kHz ہے، فریم کی لمبائی N=256 ہے، اور آفسیٹ کی لمبائی M=160 ہے۔ اوورلیپ فریم کی لمبائی کا 62.5 فیصد ہے۔ عام طور پر فریم کی لمبائی کے 50 فیصد سے 75 فیصد کی کوریج کی سفارش کی جاتی ہے۔

4.2 ہیننگ ونڈو اور کم ہوتی قدریں۔

ایک ہیننگ ونڈو کا سائز 1D استعمال کیا گیا تھا۔ ہیننگ ونڈو کو ابھری ہوئی کوزائن ونڈو بھی کہا جاتا ہے۔ ہیننگ ونڈو کو تین مستطیل ٹائم ونڈوز کے فریکوئنسی سپیکٹرم کے مجموعہ کے طور پر سوچا جا سکتا ہے۔ یہ اعلی تعدد مداخلت اور توانائی کے رساو کو ختم کرتے ہوئے، ایک دوسرے کو منسوخ کرنے کے لیے سائیڈ لابس کا استعمال کر سکتا ہے۔ ہیننگ ونڈوز بہت مفید ونڈو فنکشنز ہیں۔

cistanche—Improve memory4

میرے نزدیک Cistanche ضمیمہ - یادداشت کو بہتر بنانے والا

Cistanche بہتر بنانے والی یادداشت اور الزائمر کی بیماری سے بچاؤ کی مصنوعات دیکھنے کے لیے یہاں کلک کریں۔

【مزید پوچھیں】 ای میل:cindy.xue@wecistanche.com / واٹس ایپ: 0086 18599088692 / وی چیٹ: 18599088692

ایک وزنی باکس مسخ کو کم کرنے اور انفرادی فریموں کو ہموار کرنے کے لیے استعمال کیا جاتا ہے۔ فلوٹنگ سگنل جس کی اس تحقیق میں جانچ کی گئی ہے وہ گھنے لہجے پر مشتمل ہے۔ فلیٹ ٹون کی شدت کا تعین فریکوئنسی f پر خالص ٹون کی شدت سے کیا جاتا ہے، جسے ہیننگ ونڈو کے ذریعے فلٹر کیا جاتا ہے۔

اس ونڈو کا ایک اہم پہلو یہ ہے کہ یہ فریموں کی سرحدوں کو صفر پر سیٹ کرتا ہے۔ اس صورت میں، کھڑکی سے گزرتے وقت مختصر توانائیوں کا حساب لگایا جا سکتا ہے، اور انہیں اس ترتیب سے منتقل کیا جا سکتا ہے جو سب سے کم طول و عرض کی توانائیوں کا حساب لگانے کے لیے استعمال ہوتا ہے۔ اس کا مقصد اس ونڈو سے سگنل کو ہموار کرتے ہوئے سگنل کی توانائی کا حساب لگا کر سگنل سے کم توانائی والے سگنلز کو ہٹانا ہے۔ اس عمل کے لیے درج ذیل سگنل توانائی کی مساوات کی ضرورت ہوتی ہے۔


image

جہاں En ان پٹ سگنل کے ٹکڑے کی توانائی ہے، اور xi سگنل کی قدر ہے۔

(11) کا استعمال کرتے ہوئے ونڈو کے عمل کے علاوہ، اگلے مرحلے میں سگنل پر کارروائی کی جاتی ہے، جو پروسیسر میں داخل ہونے والی قدروں کی تعداد کو نمایاں طور پر کم کرتی ہے۔ شکل 7 متوازی پروسیسنگ الگورتھم پیش کرتا ہے۔

ونڈو کا سائز متعدد نمونوں اور مدت کی نمائندگی کرتا ہے۔ یہ تجزیہ کا بنیادی پیرامیٹر ہے۔ ونڈو کا سائز بنیادی تعدد، شدت اور سگنل میں ہونے والی تبدیلیوں پر منحصر ہے۔

image

شکل 7۔ خاموش حصوں کو ہٹانے کے لیے ہیننگ ونڈو الگورتھم۔ 4.3 شارٹ ٹائم فوئیر ٹرانسفارم (STFT) سوئچز اونچی یا کم اونچائی کے معنی کے بارے میں ایک بدیہی سمجھ موجود ہے۔ ایس ٹی ایف ٹی ایک فوئیرریلیٹڈ ٹرانسفارم ہے جو وقت کے ساتھ بدلتے وقت سگنل کے مقامی حصوں کی سائنوسائیڈل فریکوئنسی اور فیز مواد کا تعین کرنے کے لیے استعمال ہوتا ہے۔ عملی طور پر، STFT کمپیوٹیشن میں لمبے وقت کے سگنل کو مساوی لمبائی کے چھوٹے حصوں میں تقسیم کرنا شامل ہے، جس کے بعد ہر چھوٹے حصے پر فوئیر ٹرانسفارم کا الگ حساب لگایا جاتا ہے۔ اس سے ہر چھوٹے حصے کے فوئیر سپیکٹرم کا پتہ چلتا ہے۔ عملی طور پر استعمال کیا جاتا ہے. متعلقہ ٹائم فریکوئینسی کنورژن ایک مجرد فوئیر کنورژن ہے، جو سگنل Xn کی لمبائی کو N کوفیشینٹس کے پیچیدہ ویلیو فریکوئنسی ڈومین کے نمائندے کے طور پر بیان کرتا ہے۔ STFT، جو وقت کے ساتھ تعدد کے اجزاء کے ارتقاء کو بیان کرتا ہے، تقریر کے تجزیہ اور پروسیسنگ کے لیے سب سے زیادہ استعمال ہونے والے ٹولز میں سے ایک ہے [50]۔ خود سپیکٹرم کی طرح، STFT کا ایک فائدہ یہ ہے کہ اس کے پیرامیٹرز کی جسمانی اور بدیہی تشریحات ہیں۔ STFT کو عام طور پر لاگ اسپیکٹرا 20log10 (X(h, k)) کا استعمال کرتے ہوئے تصور کیا جاتا ہے۔ اس طرح کے 2D لاگ سپیکٹرا کو پھر تھرمل نقشہ کا استعمال کرتے ہوئے دیکھا جا سکتا ہے جسے سپیکٹروگرام کہا جاتا ہے۔ الگورتھم کے تیسرے مرحلے میں، STFT سپیکٹرل سوئچنگ کا طریقہ کار ان فریموں پر لاگو کیا جاتا ہے جو وزن کی کھڑکی سے گزرتے ہیں۔ سگنل کا STFT کھڑکیوں کو کھول کر اور ہر ونڈو کے DFT کا تعین کرکے حاصل کیا جاتا ہے۔ خاص طور پر، ان پٹ سگنل کی Xn اور Wn ونڈوز کے لیے تبدیلی کا تعین اس طرح کیا جاتا ہے:

image

جہاں k-index تعدد کی قدروں سے مطابقت رکھتا ہے، اور wn ونڈو کا فنکشن ہے، جو کہ عام طور پر ایک ہیننگ ونڈو یا Gaussian ونڈو ہے جو صفر کے ارد گرد مرکوز ہوتی ہے۔

4.4 میل ٹرانسفارم

چوتھے مرحلے میں، فریکوئنسی بینڈ میں منتقل ہونے والے سگنل کو تکونی فِلٹرز کا استعمال کرتے ہوئے رینجز میں تقسیم کیا جاتا ہے۔ چاک فریکوئنسی کا استعمال کرتے ہوئے فلٹر کی حدود کا حساب لگایا جاتا ہے۔ چاک فریکوئنسی ففیلڈ میں منتقلی درج ذیل مساوات پر مبنی ہے:

image

جہاں f تعدد کی حد ہے۔

ریورس سوئچ کا تعین اس طرح کیا جاتا ہے:

image

NN کو fifilters کی تعداد کے طور پر (26 fifilters عام طور پر استعمال کیا جاتا ہے) اور flflows، مطالعہ کے تحت فریکوئنسی کی حد جتنی زیادہ ہے۔ یہ رینج میل اسکیل میں منتقل کی جاتی ہے اور NN کو یکساں طور پر تقسیم شدہ ایک دوسرے کو ملانے والی حدود میں تقسیم کیا جاتا ہے۔ لکیری فریکوئنسی کے لیے موزوں حدود کا تعین ففیلڈ کے اندر کیا جاتا ہے، جب کہ فِفلٹریشن کی بنیاد پر حاصل کیے جانے والے وزن کے گتانک کو H سے ظاہر کیا جاتا ہے۔ درج ذیل اظہار کی وجہ سے جو قدریں حاصل کی جاتی ہیں وہ لوگارتھمک ہیں:

image

واحد ویلیو ڈیکمپوزیشن الگورتھم MFCCs کا حساب لگانے کے آخری مرحلے میں لاگو کیا جاتا ہے۔

5. تجرباتی نتائج

ہم نے 4.90 GHz CPU، 32 GB RAM، اور دو Nvidia GeForce 2080Ti GPUs کے ساتھ ایک PC پر ویژول اسٹوڈیو 2019 C پلس پلس میں مجوزہ طریقہ کو لاگو کیا اور تجربہ کیا، جیسا کہ جدول 4 میں دکھایا گیا ہے۔ سسٹم کو مختلف ڈیوائس ماحول میں آزمایا گیا سگنل فیچر نکالنے کے طریقہ کار کی کارکردگی کا جائزہ لیں۔ تجربات میں، الگورتھم کے آپریشن کے دوران (شکل 8)، جب سگنل کی سطحوں کی ترتیب n=15 تھی، اقدار کی تعداد میں 40–50 فیصد کمی واقع ہوئی، اور پروسیسنگ کے وقت میں 1 اضافہ ہوا۔ 2- گنا۔ اس کے نتیجے میں، اس الگورتھم نے نمایاں طور پر اعلی کارکردگی کا مظاہرہ کیا۔ مزید یہ کہ اس الگورتھم نے ہیننگ ونڈو سے گزرتے ہوئے خاموشی کے علاقوں کو الگ کرنے اور ختم کرنے کے قابل بنایا۔

میموری بینڈوڈتھ کے ضیاع سے بچنے کے لیے کئی ممکنہ ذرائع دستیاب ہیں۔ ہم ایک نیا حل تجویز کرتے ہیں جو سگنل فریم کے سائز کو کیش میموری کے بلاک سائز سے ملا کر کمپیوٹنگ کی کارکردگی کو بڑھاتا ہے۔ اس قسم کی اصلاح متوازی پروسیسنگ کی مجموعی کارکردگی کو نمایاں طور پر متاثر کر سکتی ہے۔ تاہم، ملٹی کور پروسیسرز پر عمل درآمد کے ذریعے سگنل کو فریموں میں تقسیم کرکے ڈیجیٹل سگنل پروسیسنگ میں استعمال کیا جا سکتا ہے۔ تاہم، عملی طور پر، انتخاب عام طور پر چھوٹے پیمانے پر کیا جاتا ہے، ڈیٹا بس کی چوڑائی کے مطابق جو کیش میموری کو مین میموری اور اس کے بلاک کے سائز سے جوڑتا ہے۔ ہمارا طریقہ متوازی کمپیوٹنگ میں ان یادوں کے بہترین استعمال کو لاگو کرتا ہے۔ ڈیٹا کو اسٹریمز میں تقسیم کرتے وقت کیش میموری کی تنظیم متوازی پروسیسنگ الگورتھم میں اہم کردار ادا کرتی ہے۔ خاص طور پر، ڈیجیٹل سگنل پروسیسنگ میں ویکٹر میٹرکس اثرات کی موجودگی اور ان کے اسٹریمز کے سائز کو کیش بلاکس کے سائز کے مطابق ایڈجسٹ کیا جانا چاہیے۔ یہ مجوزہ طریقہ استعمال کرتے ہوئے حاصل کیا جا سکتا ہے، جیسا کہ تصویر 9 میں دکھایا گیا ہے۔

جدول 4۔ تجرباتی سیٹ اپ کی تفصیلی وضاحتیں۔

image

image

شکل 8۔ (a) ابتدائی آنے والا سگنل اور (b) مجوزہ الگورتھم کو لاگو کرنے کے بعد سگنل کی ظاہری شکل۔

image

شکل 9. RK3288 پروسیسرز کا استعمال کرتے ہوئے متوازی کمپیوٹنگ ڈھانچہ۔

اس حصے میں، ہم مختلف نظاموں کی کارکردگی کا موازنہ کرنے کے لیے ایک مقداری تجزیہ پر تبادلہ خیال کرتے ہیں۔ ہم نے اپنے طریقہ کار کا موازنہ گہرے سیکھنے کے طریقوں کی بنیاد پر معروف اسپیچ ریکگنیشن الگو ریتھمز سے کیا۔ تقریر کی شناخت کے لیے مختلف حکمت عملیوں کو کمپیوٹنگ کرنے اور مختلف طریقوں کی کارکردگی کا اندازہ لگانے کے لیے تشخیصی میٹرکس ضروری ہیں۔ اگرچہ ہم نے موازنہ کے لیے دیگر مطالعات کے نتائج کا استعمال کیا، ہمیں یقین نہیں ہے کہ آیا وہ درست ہیں کیونکہ ان طریقوں کے ماخذ کوڈز اور ڈیٹا سیٹس حقیقی کارکردگی کی تصدیق کے لیے عوامی طور پر دستیاب نہیں ہیں۔ تصویر 10 مجوزہ تیز رفتار الگورتھم کی بنیاد پر ہان ننگ ونڈو کے ذریعے تقریر کے سگنل کے ٹکڑے کے گزرنے کے دوران خاموش حصوں کو دوبارہ منتقل کرنے کے نتیجے کو ظاہر کرتا ہے۔ تجزیہ سے حاصل کردہ رفتار کے نتائج جدول 5 میں پیش کیے گئے ہیں۔

image

شکل 10. KNN الگورتھم کی k قدر (خصوصیات کے انتخاب کے ساتھ)۔

جدول 5۔ مجوزہ طریقہ کے تجرباتی نتائج۔

image

پڑوس کی ڈگری معلوم کرنے کے لیے ایک رینج کا تعین کیا گیا ہے جو KNN الگورتھم میں بہترین درستگی کی قدر دیتا ہے۔ مخصوص رینج 1-25 پر محیط ہے۔ شکل 10 میں، خصوصیت کے انتخاب کے ساتھ KNN الگورتھم کا گراف لاگو کیا گیا تھا۔ جب گراف کی جانچ کی گئی، جب پڑوس کی قیمت شروع میں 1 تھی، تربیت کی درستگی ٹیسٹ کی درستگی سے بہت زیادہ تھی۔ ارتباط کے ذریعہ منتخب کردہ خصوصیات کا استعمال کرتے ہوئے بنائے گئے KNN الگورتھم میں، ماڈل کی درستگی کا تعین ٹریننگ ڈیٹاسیٹ میں 99.15 فیصد اور ٹیسٹ ڈیٹاسیٹ میں 97.35 فیصد تھا۔

لفظ ایرر ریٹ (WER) یا کریکٹر ایرر ریٹ کو عام طور پر اسپیچ سگنل سے فیچر نکالنے کی درستگی کا اندازہ لگانے کے لیے استعمال کیا جاتا ہے۔ یہ معروضی میٹرکس ہیں جو پہچان کی تکنیک کے منصفانہ موازنہ کے لیے مددگار ہیں۔ ہماری پچھلی مطالعات [51-56] میں، ہم نے میٹرکس کی گنتی کی جیسے F-measure (FM)، درستگی، اور یاد کرنا۔ FM وزنی اوسط ہے جو درستگی اور یاد کرنے کی شرحوں کے درمیان پیمائش کو متوازن کرتی ہے۔ درستگی صحیح پیشین گوئی شدہ مثبت مشاہدات کی کل تعداد اور پیشین گوئی شدہ مثبت مشاہدات کی تعداد کا تناسب ہے۔ یادداشت صحیح طور پر پیش گوئی کی گئی مثبت مشاہدات کی تعداد کا اصل کلاس میں مشاہدات کی کل تعداد کا تناسب ہے، جیسا کہ (9) میں اشارہ کیا گیا ہے۔ درج ذیل مساوات کو فیچر نکالنے کے طریقوں کی اوسط درستگی اور یاد کرنے کی شرح کا حساب لگانے کے لیے استعمال کیا جا سکتا ہے:

image

جہاں TP حقیقی مثبت کی تعداد کو ظاہر کرتا ہے، FP جھوٹے مثبت کی تعداد کو ظاہر کرتا ہے، اور FN غلط منفیوں کی تعداد کو ظاہر کرتا ہے۔

FM کا حساب (10) استعمال کرتے ہوئے کیا جاتا ہے، درستگی اور یاد دونوں کو مدنظر رکھتے ہوئے۔

image

مجوزہ طریقہ کی اوسط ایف ایم، یاد، اور درستگی 98.4 فیصد تھی۔ مائیکروفون پر سگنلز کے ناپسندیدہ شور کی وجہ سے 1.6 فیصد کیسز میں جھوٹ کا پتہ چلا۔ ماڈل کی درستگی کی حد 0 اور 1 کے درمیان تھی، اور میٹرک تخمینہ کے اسکور 1 پر اپنی بہترین اقدار تک پہنچ گئے۔ ہمارے طریقہ کار اور دیگر حال ہی میں شائع ہونے والے اسپیچ فیچر نکالنے کے طریقوں کا ایک جائزہ ٹیبل 6 میں پیش کیا گیا ہے۔ خصوصیات کا ایک منصفانہ موازنہ کے لیے استعمال کیا گیا تھا۔ ہر گروپ کے کل 325 تقریری نمونوں کا تجزیہ اسی طرح کی خصوصیت والے پس منظر والے مضامین سے کیا گیا۔ ایم ایف سی سی میں فلٹر بینکوں کی تعداد کے مطابق مختلف فریم کی لمبائی کے اثرات اور ایل پی سی کی ترتیب میں مختلف فریم کی لمبائی کو بھی بہتر درستگی کے لیے جانچا گیا۔

جدول 6. تقریر کی خصوصیت نکالنے کے مقداری درستگی کے نتائج۔

image

جیسا کہ پہلے ذکر کیا گیا ہے، WER تقریر کی شناخت کی کارکردگی کا سب سے عام پیمانہ ہے۔ اس کی گنتی اسپیچ آرگنائزر کے آؤٹ پٹ کے ساتھ ریفرنس ٹرانسکرپشن کا موازنہ کرکے کی جاتی ہے۔ اس موازنہ کی بنیاد پر، غلطیوں کی تعداد کا حساب لگانا ممکن ہے، جو عام طور پر تین زمروں سے تعلق رکھتی ہیں: (1) اندراج جب کوئی لفظ خودکار اسپیچ ریکگنیشن (ASR) کے آؤٹ پٹ میں حوالہ میں موجود نہ ہو، (2) حذف کرنا جب ASR آؤٹ پٹ میں کوئی لفظ چھوٹ جاتا ہے، اور (3) متبادل جب ایک لفظ دوسرے لفظ سے الجھ جاتا ہے۔ WER کو مندرجہ ذیل طریقے سے شمار کیا جا سکتا ہے۔

image

جہاں S الفاظ کے متبادلات کی تعداد ہے جو غلط طریقے سے پہچانے گئے ہیں، D حذف کیے جانے والوں کی تعداد ہے، I اندراجات کی تعداد ہے، اور N حوالہ نقل میں الفاظ کی تعداد ہے۔ اس اسکور کو کمپیوٹنگ کرنے میں اہم مسئلہ دو الفاظ کی ترتیب کے درمیان صف بندی ہے۔ اس کا تعین لیونشٹین فاصلہ [67] کا استعمال کرتے ہوئے متحرک پروگرامنگ کے ذریعے کیا جاسکتا ہے۔

جدول 6 کی بنیاد پر، ہم نے WER تشخیصی میٹرک کا استعمال کرتے ہوئے مقابلے کے طریقوں کی اوسط درستگی کی نشاندہی کرنے کے لیے ایک شماریاتی تجزیہ کیا، جیسا کہ شکل 11 میں دکھایا گیا ہے۔ بہتر فیچر ایکسٹریکٹر نے تقریباً 98.4 فیصد درستگی حاصل کی، جب کہ دیگر طریقوں سے درستگی حاصل ہوئی۔ 78 فیصد اور 96 فیصد۔ ہم نے موازنہ کے لیے متعلقہ کاغذات میں فراہم کردہ نتائج کا استعمال کیا؛ تاہم، ان اقدار کی درستگی آسانی سے قابل تصدیق نہیں ہے کیونکہ ان طریقوں کے سورس کوڈز اور ڈیٹاسیٹس ان کی حقیقی کارکردگی کی تصدیق کے لیے عوامی طور پر دستیاب نہیں ہیں۔ اس کے باوجود، معیاری مناظر کی صورت میں، مجوزہ طریقہ کو تجرباتی طور پر ظاہر کیا گیا تاکہ کمپیوٹیشنل وقت کو کم کرکے تقریر کی بہترین خصوصیت نکالنے کی درستگی فراہم کی جا سکے، یہاں تک کہ جب تقریر کا ڈیٹا شور یا کم معیار کا ہو۔

Figure 11. Quantitative results of speech signal feature extraction approaches using vertical graphs.

تصویر 11. عمودی گراف کا استعمال کرتے ہوئے تقریر سگنل کی خصوصیت نکالنے کے نقطہ نظر کے مقداری نتائج۔

مزید یہ کہ ہم نے منتخب طریقوں کے غلط مثبت نتائج کا جائزہ لیا۔ جیسا کہ شکل 12 سے مشاہدہ کیا جا سکتا ہے، مجوزہ طریقہ کار میں سب سے کم غلطیاں تھیں۔ مزید برآں، انتہائی موثر متوازی حساب کے طریقہ کار نے صوتی سگنل کی خصوصیت کے انتخاب اور نکالنے کی غلطیوں کو نمایاں طور پر کم کیا۔ تربیت کے دوران اوور فِٹنگ ایک اہم مسئلہ تھا، اور تقریباً تمام مشین لرننگ ماڈلز اس کا شکار ہیں۔ ہم نے فیچر سلیکشن تکنیک کا استعمال کرتے ہوئے اوور فٹنگ کے خطرے کو کم کرنے کی کوشش کی جس کا مقصد ڈیٹاسیٹ میں موجودہ خصوصیات کی اہمیت کو درجہ بندی کرنا اور کم اہم کو ضائع کرنا ہے (کوئی نئی خصوصیات نہیں بنائی گئی ہیں)۔

image

تصویر 12. جھوٹے-مثبت اسپیچ سگنل فیچر نکالنے کے تجربات کے مرئی نتائج۔

جدول 7 ان طریقوں کی کارکردگی کے نتائج دکھاتا ہے جو مختلف خصوصیات کی بنیاد پر تقریر کی شناخت کے ماحول میں استعمال ہوتے تھے۔ ہمارا مجوزہ نقطہ نظر ناپسندیدہ اور غیر ضروری پس منظر کے شور سے متاثر نہیں ہوتا ہے اور یہ کم معیار کی انسانی آوازوں سے متاثر نہیں ہوتا ہے جیسے کرکھی آوازیں، گلے میں خراش کے ساتھ پیدا ہونے والی آوازیں، یا یہاں تک کہ آواز کے مکمل نقصان کے ساتھ انسانوں کی آوازیں بھی۔ ہمارے طریقہ کار کا مقصد ریکارڈنگ کے ناکافی آلات، پس منظر کے شور، مشکل لہجوں اور بولیوں، اور آواز میں مختلف پچوں کے مسئلے پر قابو پانا ہے۔ ایک عام ماحول میں، کم پروسیسنگ وقت کے ساتھ مجوزہ طریقہ کا استعمال کرتے ہوئے تقریر کی خصوصیت کے چیلنجوں کا درست طریقے سے پتہ لگانے اور نکالنے کے بہترین نتائج حاصل کیے گئے۔

جدول 7. مختلف خصوصیات کا استعمال کرتے ہوئے تقریر کی خصوصیت کا پتہ لگانے اور نکالنے کی کارکردگی کا جائزہ۔

image

تقریر کی شناخت کے طریقوں کے نتائج کو سات زمروں کے لیے طاقتور، نارمل یا کمزور کے طور پر درجہ بندی کیا گیا تھا۔ طاقتور معیار یہ ظاہر کرتا ہے کہ الگورتھم ہر قسم کے چیلنجوں پر قابو پا سکتا ہے۔ اس کے برعکس، عام معیار یہ بتاتا ہے کہ الگورتھم بعض صورتوں میں ناکام ہو سکتا ہے کیونکہ لفظ کی حدود کی پہلے سے وضاحت نہیں کی گئی ہے۔ آخر میں، کمزور معیار بتاتا ہے کہ پس منظر کے شور یا کمپن کے تحت الگورتھم ناقابل اعتبار ہے۔

6. حدود

یہ نتیجہ اخذ کرنا مشکل ہے کہ آج تک جو طریقے تجویز کیے گئے ہیں ان میں کوئی کمی نہیں آئی۔ ہمارے مجوزہ طریقہ کے نتیجے میں مختلف شور کے ماحول کی وجہ سے غلطیاں بھی ہو سکتی ہیں۔ اس مسئلے پر قابو پانے کے لیے، ہمارا مقصد موجودہ خصوصیات سے نئی خصوصیات بنا کر ڈیٹاسیٹ میں فیچرز کی تعداد کو کم کرنا ہے [69]۔ چونکہ مقابلے کے دوران مختلف ماڈلز کی تربیت کے لیے اوور فائٹنگ ایک اہم مسئلہ تھا، اس لیے مختلف وسائل سے ڈیٹا کے نمونے شامل کر کے تربیتی ڈیٹا کو بہتر بنانا نتائج کو بہتر بنانے کا ایک ممکنہ حل ہو سکتا ہے۔ مذکورہ بالا مسائل سے قطع نظر، تجرباتی نتائج سے معلوم ہوا کہ ہمارا طریقہ تقریر کی خصوصیت نکالنے کے کاموں کے لیے بہت مضبوط اور موثر تھا، جس کی اوسط درستگی 98.4 فیصد اور FM 99.5 فیصد تھی۔

7. نتائج

اسپیچ ریکگنیشن سسٹمز کے لیے مشین لرننگ کے طریقہ کار کا استعمال کرتے ہوئے ایک نیا اعلیٰ کارکردگی متوازی کمپیوٹنگ اپروچ تجویز کیا گیا ہے۔ محدود کمپیوٹنگ وسائل والی مشینوں میں سرعت کے مسائل کو تقسیم شدہ نظاموں کے ذریعے حل کیا جا سکتا ہے۔ سگنل کی شناخت کے نظام میں حساب کی رفتار کو بڑھایا جا سکتا ہے، اور ملٹی کور پلیٹ فارمز کی کارکردگی کو موثر اور تیز رفتار الگو رتھمز بنا کر اور استعمال کر کے بہتر کیا جا سکتا ہے۔ نتائج ظاہر کرتے ہیں کہ مجوزہ ماڈل پروسیسنگ کے وقت کو کم کرتا ہے اور MFCCs کو مؤثر طریقے سے استعمال کرکے فیچر نکالنے کی درستگی کو 98.4 فیصد تک بہتر بناتا ہے۔ یہ دیکھا گیا ہے کہ فیچر سلیکشن کے ذریعے اخذ کردہ کم ارتباطی اقدار کے ساتھ خصوصیات بھی ماڈل کی کامیابی میں کارگر ہوتی ہیں۔ اعداد و شمار کا تجزیہ پہلے سے پروسیس شدہ ڈیٹا پر کیا گیا تھا، اور K-nearest پڑوسیز (KNN) مشین لرننگ الگورتھم کا استعمال کرتے ہوئے ڈیٹا سے بامعنی معلومات تیار کی گئی تھیں۔

مستقبل کے مطالعے میں گہرے سیکھنے کے طریقوں کا استعمال کرتے ہوئے اور اسپیچ سگنلز کا پتہ لگانے اور کوالٹی کے نمایاں نقصان کے بغیر نکالنے کے لیے ملٹی کور پروسیسرز کی کیش میموری کو بہتر بنانے کے ذریعے ہمارے طریقہ کار کی درستگی کو بہتر بنانے پر توجہ مرکوز کی جائے گی۔ مزید برآں، ہم مضبوط تجزیہ کارکردگی کے ساتھ متوازی پروسیسنگ کی بنیاد پر ایک سپیکٹرل تجزیہ ماڈل تیار کرنے کا ارادہ رکھتے ہیں جو 3D CNN اور 3D U-Net ماحولیات میں Taris اسپیچ ڈیٹاسیٹس [70] کا استعمال کرتے ہوئے کم کمپیوٹیشنل وسائل کے ساتھ ایمبیڈڈ ڈیوائسز کے قیام کے قابل بنائے گا [71– 75]

حوالہ جات

1. مینگ، وائی جے؛ لیو، ڈبلیو جے؛ ژانگ، آر زیڈ؛ ڈو، ایچ ایس اسپیچ فیچر پیرامیٹر نکالنا اور انٹرپولیشن کی بنیاد پر پہچان۔ اپل میچ میٹر 2014، 602–605، 2118–2123۔ [کراس ریف] 2. موسیوف، ایم. راخیموف، ایم. Convolutional Neural Networks کے لیے تیز رفتار تربیت۔ انفارمیشن سائنس اینڈ کمیونیکیشن ٹیکنالوجیز (ICISCT) پر 2020 کی بین الاقوامی کانفرنس کی کارروائی میں، تاشقند، ازبکستان، 4-6 نومبر 2020؛ صفحہ 1-5۔ [کراس ریف] 3. Ye, F.; یانگ، جے ڈیپ نیورل نیٹ ورک ماڈل برائے اسپیکر کی شناخت۔ اپل سائنس 2021، 11، 3603۔ [کراس ریف] 4۔ موسیوف، ایم۔ راخیموف، ایم۔ سپیچ سگنل کی متوازی پروسیسنگ میں مین میموری کے بلاک کو کیش میں میپ کرنے کا طریقہ۔ انفارمیشن سائنس اینڈ کمیونیکیشن ٹیکنالوجیز (ICISCT) پر 2019 کی بین الاقوامی کانفرنس کی کارروائی میں، کراچی، پاکستان، 9-10 مارچ 2019؛ صفحہ 1-4۔ [کراس ریف] 5. جیانگ، این. Liu, T. SOM اور k-means پر مبنی تقریر کی تقسیم اور کلسٹرنگ الگورتھم۔ ریاضی مسئلہ انج. 2020, 2020, 3608286۔ [کراس ریف] 6. Hu, W.; یانگ، زیڈ؛ چن، سی. سورج، B. Xie, Q. عددی کنٹرول برج کے ملٹی ایکشن سسٹم کے لیے ایک کمپن سیگمنٹیشن اپروچ۔ سگنل امیج ویڈیو پروسیس۔ 2021، 16، 489–496۔ [کراس ریف]

7. پوپیسکو، ٹی ڈی؛ Aiordachioaie، D. ہلنے والے سگنلز کی بہترین سیگمنٹیشن کا استعمال کرتے ہوئے رولنگ عنصر بیرنگ کی غلطی کا پتہ لگانا۔ میچ سسٹم سگنل کا عمل۔ 2019، 116، 370–391۔ [کراس ریف] 8. شہاب، ایم ایس ایچ؛ آدتیہ، ایس. سیٹو، جے ایچ؛ امتیاز الدین، کے ایم؛ Efat، MIA A Hybrid GRU-CNN فیچر نکالنے کی تکنیک برائے اسپیکر کی شناخت۔ کمپیوٹر اینڈ انفارمیشن ٹیکنالوجی (ICCIT) پر 2020 23ویں بین الاقوامی کانفرنس کی کارروائی میں، ڈھاکہ، بنگلہ دیش، 19-21 دسمبر 2020؛ صفحہ 1-6۔ [کراس ریف] 9. کورکماز، او. Atasoy، A. میل فریکوئنسی سیپسٹل کوفیشینٹس کا استعمال کرتے ہوئے اسپیچ سگنل سے جذبات کی شناخت۔ الیکٹریکل اینڈ الیکٹرانکس انجینئرنگ (ELECO) پر 9ویں بین الاقوامی کانفرنس کی کارروائی میں، برسا، ترکی، 26-28 نومبر 2015؛ صفحہ 1254–1257۔ 10. ایاز، یو۔ Gürüler, H.; خان، ایف۔ احمد، ن. وانگبو، ٹی. عبدالسالموف، اے. مشین لرننگ کے ذریعے میل فریکوئنسی سیپسٹرل کوفیفینٹس کا استعمال کرتے ہوئے خودکار اسپیکر کی شناخت۔ CMC-Comput۔ میٹر جاری رکھیں۔ 2022، 71، 5511–5521۔ 11. القادری، ایم. لہمر، ای. Rad, A. متضاد درجہ بندی کے فیوژن اور تکمیلی فیچر کوآپریشن کے ذریعے دو سطحی اسپیکر کی شناخت کا نظام۔ سینسر 2021, 21, 5097۔ [کراس ریف] 12. باتور دنلر، Ö. Aydin، N. ایک بہترین فیچر پیرامیٹر سیٹ ہے جس کی بنیاد پر گیٹڈ ریکرنٹ یونٹ ریکرنٹ نیورل نیٹ ورکس پر اسپیچ سیگمنٹ کی کھوج کے لیے۔ اپل سائنس 2020، 10، 1273۔ [کراس ریف] 13۔ کم، ایچ۔ شن، JW Dual-Mic Speech Enhancement TF-GSC پر مبنی لیکیج سپریشن اور سگنل ریکوری کے ساتھ۔ اپل سائنس 2021، 11، 2816۔ [کراس ریف] 14. لی، ایس-جے؛ Kwon، H.-Y. اسپیچ سیگمنٹ کی کھوج کی بنیاد پر اسپیچ ڈیٹا کو ختم کرنے کے لیے ایک پری پروسیسنگ حکمت عملی۔ اپل سائنس 2020, 10, 7385۔ [کراس ریف] 15. Rusnac, A.-L. Grigore, O. CNN آرکیٹیکچرز اور EEG خیالی تقریر کی شناخت کے لیے فیچر نکالنے کے طریقے۔ سینسر 2022، 22، 4679۔ [کراس ریف] [پب میڈ] 16۔ وفا، آر۔ خان، ایم کیو؛ ملک، ایف۔ عبدالسلاموف، اے بی؛ چو، YI؛ Odarchenko, R. پراجیکٹ کی کامیابی پر چست طریقہ کار کا اثر، پاکستان کی آئی ٹی انڈسٹری میں فرد کی ملازمت کے لیے اعتدال پسند کردار کے ساتھ۔ اپل سائنس 2022، 12، 10698۔ [کراس ریف] 17۔ اگروال، اے۔ سریواستو، اے. اگروال، اے. چاہل، این۔ سنگھ، ڈی. النعیم، اے اے؛ الھدلق، اے. لی، H.-N. گہری سیکھنے کا استعمال کرتے ہوئے تقریر کے جذبات کی شناخت کے لئے دو طرفہ خصوصیت نکالنا۔ سینسر 2022، 22، 2378۔ [کراس ریف] [پب میڈ] 18۔ مارینی، ایم۔ وینیلو، این. Fanucci, L. Dysarthria کے ساتھ لوگوں کے لئے خود کار طریقے سے تقریر کی شناخت کی کارکردگی کو بہتر بنانے کے لئے اسپیکر پر منحصر خصوصیت نکالنے کے پیرامیٹرز کو بہتر بنانا. سینسر 2021، 21، 6460۔ [کراس ریف] 19. تیواری، ایس۔ جین، اے. شرما، اے کے؛ المصطفی، کے ایم فونو کارڈیوگرام سگنل پر مبنی ملٹی کلاس کارڈیک ڈائیگنوسٹک ڈیسیژن سپورٹ سسٹم۔ IEEE رسائی 2021, 9, 110710–110722۔ [کراس ریف] 20. محتاج، ایس. شمٹ، وی. Möller, S. نفرت انگیز تقریر کی شناخت کے لیے ایک خصوصیت نکالنے پر مبنی ماڈل۔ arXiv 2022, arXiv: 2201.04227۔ 21. کلدوشبے، اے. عبدالسلاموف، اے. مخدینوف، ایم. باراتوف، این. مخمودوف، ایف. Cho, YI CNN پر استعمال ہونے والی الٹراساؤنڈ امیجز کے لیے خودکار درجہ بندی کے طریقہ کار میں بہتری۔ انٹر جے ویولیٹ ملٹی ریزولوشن انف۔ عمل 2022، 20، 2150054. 22. پاسریچا، وی. اگروال، آر کے ڈیپ سی این این کا ایک ہائبرڈ اور خودکار اسپیچ ریکگنیشن کے لیے دو طرفہ LSTM۔ جے انٹیل۔ سسٹم 2020، 29، 1261–1274۔ [کراس ریف] 23. مخمادییف، اے. خوجیروف، آئی۔ Djuraev, O.; Cho, J. ازبک زبان کے لیے گہری سیکھنے کے طریقوں پر مبنی خودکار تقریر کی شناخت کا طریقہ۔ سینسر 2022، 22، 3683۔ [کراس ریف] [پب میڈ] 24۔ لی، ایف۔ لیو، ایم؛ زاؤ، وائی؛ کانگ، ایل. ڈونگ، ایل. لیو، ایکس؛ Hui, M. 1D convolutional neural نیٹ ورکس کا استعمال کرتے ہوئے دل کی آواز کی خصوصیت نکالنا اور درجہ بندی کرنا۔ EURASIP J. Adv. سگنل کا عمل۔ 2019، 2019، 59۔ [کراس ریف] 25۔ چانگ، ایل سی۔ ہنگ، جے ڈبلیو۔ گہرے صوتی ماڈلز میں ریاستوں کے امکان کو زیادہ سے زیادہ کرنے پر مبنی مضبوط تقریر کی خصوصیت نکالنے کا ایک ابتدائی مطالعہ۔ اپل سسٹم انوو 2022، 5، 71۔ [کراس ریف] 26۔ رامیریز، جے۔ Górriz, JM; سیگورا، جے سی وائس ایکٹیویٹی ڈیٹیکشن۔ بنیادی باتیں اور تقریر کی شناخت کے نظام کی مضبوطی۔ مضبوط تقریر کی شناخت اور تفہیم میں؛ Grimm, M., Kroschel, K., Eds.; I-TECH تعلیم اور اشاعت: لندن، برطانیہ، 2007؛ صفحہ 1-22۔ 27. اوہ، S. DNN پر مبنی مضبوط تقریر کی خصوصیت نکالنے اور سگنل شور ہٹانے کا طریقہ تقریر کی شناخت کے لیے بہتر اوسط پیشین گوئی LMS فلٹر کا استعمال کرتے ہوئے۔ جے کنورگ Inf. ٹیکنالوجی. 2021، 11، 1-6۔ [کراس ریف] 28. عباسچیان، بی جے؛ سیرا سوسا، ڈی۔ ایلمغربی، اے ڈیپ لرننگ ٹیکنیکس فار سپیچ ایموشن ریکگنیشن، ڈیٹا بیس سے ماڈلز تک۔ سینسرز 2021، 21، 1249۔ [کراس ریف] 29۔ رخیموف، ایم۔ مامدجانوف، ڈی۔ Mukhiddinov، A. تقسیم شدہ کمپیوٹنگ میں امیج پروسیسنگ کے لیے ایک اعلی کارکردگی کا متوازی نقطہ نظر۔ انفارمیشن اینڈ کمیونیکیشن ٹیکنالوجیز (AICT) کی درخواست پر IEEE 14ویں بین الاقوامی کانفرنس 2020 کی کارروائی میں، ازبکستان، تاشقند، 7-9 اکتوبر 2020؛ صفحہ 1-5۔ [کراس ریف] 30. عبدالسلاموف، اے. مخدینوف، ایم. Djuraev, O.; خامداموف، یو۔ وانگبو، TK خودکار نمایاں آبجیکٹ نکالنا جس کی بنیاد پر مقامی طور پر قابل اطلاق حد بندی ہے تاکہ ٹیکٹائل گرافکس تیار کیا جا سکے۔ اپل سائنس 2020، 10، 3350۔ [کراس ریف] 31۔ عبدالسلاموف، اے۔ Whangbo, TK اندرونی ماحول کے لیے سائے ہٹانے کی تکنیک کا استعمال کرتے ہوئے پیش منظر کی شناخت کے طریقہ کار میں بہتری۔ انٹر جے ویولیٹ ملٹی ریزولوشن انف۔ عمل 2017، 15، 1750039۔ [کراس ریف] 32۔ عبدوسالموف، اے۔ انڈور ویڈیو اسٹریمز کے لیے جیومیٹری اور کلر انفارمیشن کا استعمال کرتے ہوئے وانگبو، TK کا پتہ لگانا اور حرکت پذیر آبجیکٹ شیڈو کو ہٹانا۔ اپل سائنس 2019، 9، 5165۔ Springer International Publishing: Cham, Switzerland, 2015; ص 271، ISBN 978-3319207469۔ 34. مارک، ایس. اسپیچ امیجری اسپیچ کے ادراک کی حدود کو دوبارہ درست کرتی ہے۔ توجہ فرمائیں۔ ادراک سائیکوفیس۔ 2016، 78، 1496–1511۔ [کراس ریف] 35. مدگل، ای. مکنتھراج، ایس. مودک، ایم یو؛ راؤ، DSP-TMS320F28335 پر ڈیجیٹل فلٹرز کا استعمال کرتے ہوئے YS ٹیمپلیٹ پر مبنی ریئل ٹائم اسپیچ ریکگنیشن۔ کمپیوٹنگ کمیونیکیشن کنٹرول اینڈ آٹومیشن (ICCUBEA) پر 2018 کی چوتھی بین الاقوامی کانفرنس کی کارروائی میں، پونے، انڈیا، 16-18 اگست 2018؛ صفحہ 1-6۔ [کراس ریف]

شاید آپ یہ بھی پسند کریں