تشخیص خودکار گوینده مبتنی بر ویژگی های استخراج شده از بانک فیلتر گابور و شبکه های عصبی کانولوشنال | ||
| مدل سازی در مهندسی | ||
| مقاله 4، دوره 21، شماره 72، بهار 1402، صفحه 49-67 اصل مقاله (2.82 M) | ||
| نوع مقاله: مقاله پژوهشی | ||
| شناسه دیجیتال (DOI): 10.22075/jme.2022.26690.2245 | ||
| نویسندگان | ||
| عبدالرضا رشنو1؛ صادق فدایی* 2؛ عبدالصمد حمیدی3 | ||
| 1گروه مهندسی کامپیوتر، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران | ||
| 2گروه مهندسی برق، دانشکده فنی و مهندسی ، دانشگاه یاسوج، یاسوج، ایران | ||
| 3گروه مهندسی برق، دانشکده مهندسی، دانشگاه لرستان، خرم آباد، ایران | ||
| چکیده | ||
| صدای یک انسان حاوی خصوصیاتی از قبیل: قومیت، جنسیت، احساس، سن و اطلاعات دیگری از فرد است و موضوع تشخیص گوینده به شناسایی هویت افراد بر اساس صدای آنها میپردازد. اگرچه محققان در طول سالهای گذشته در این زمینه فعالیت داشتهاند و روشهایی برای بهبود دقت تشخیص گوینده پیشنهاد دادهاند اما هنوز چالشهایی در این زمینه وجود دارد. در این مقاله یک روش جدید تشخیص گوینده مبتنی بر فیلترهای گابور و شبکههای عصبی کانولوشنال ارایه شده است. در روش پیشنهادی، ابتدا اسپکتروگرام سیگنال صحبت فرد تشکیل میشود. سپس با طراحی موثر فیلترهای گابور، بانک فیلتر گابور ایجاد میگردد. در مرحلهی بعد اسپکتروگرام سیگنال از بانک فیلتر گابور عبور داده شده و ویژگیهای سیگنال صحبت استخراج میشود. در مرحلهی آخر با استفاده از یک شبکهی عصبی کانولوشنال، گوینده شناسایی میشود. برای ارزیابی روش پیشنهادی از دو پایگاه دادهی Aurora2 و TIMIT استفاده شده است. نتایج نشان میدهد که روش پیشنهادی دقت بهتری نسبت به روشهای پیشین دارد. | ||
| کلیدواژهها | ||
| بانک فیلتر گابور؛ اسپکتروگرام؛ تشخیص گوینده؛ شبکه ی عصبی کانولوشنال | ||
| مراجع | ||
|
| ||
|
آمار تعداد مشاهده مقاله: 993 تعداد دریافت فایل اصل مقاله: 732 |
||
| تعداد نشریات | 22 |
| تعداد شمارهها | 723 |
| تعداد مقالات | 10,394 |
| تعداد مشاهده مقاله | 72,862,471 |
| تعداد دریافت فایل اصل مقاله | 64,556,565 |