دستیار صوتی چیست و چگونه صدا را «میشنود»؟
دستیار صوتی نرمافزاری هوشمند است که قابلیت دریافت فرمان صوتی، تحلیل آن و اجرای یک عمل یا ارائهٔ پاسخ را دارد. برای نمونه وقتی میپرسید "امروز هوا چطور است؟"، دستیار صدای شما را ضبط کرده، کلمات را تشخیص میدهد، معنای جمله را میفهمد، دمای هوا را از یک منبع اطلاعاتی میگیرد و در نهایت با صدای از پیش طراحیشده پاسخ میدهد. این فرایند در کمتر از چند ثانیه انجام میشود.
برای درک بهتر، مسیر یک فرمان صوتی را گام به گام دنبال میکنیم:
میکروفون دستگاه (تلفن هوشمند، بلندگوی هوشمند یا لپتاپ) امواج صوتی را به سیگنال الکتریکی تبدیل میکند. سپس یک مبدل آنالوگ به دیجیتال، این سیگنال را به دنبالهای از اعداد (نمونههای صوتی) تبدیل میکند. مثلاً در هر ثانیه 44100 نمونه برداشت میشود.
الگوریتمهای پردازش گفتار، صدا را به واحدهای کوچکتری به نام واج تقسیم کرده و با استفاده از مدلهای آماری، محتملترین دنباله از کلمات را پیدا میکنند. نتیجه یک جملهٔ نوشتاری است: "امروز هوا چطور است؟"
اکنون دستیار معنای جمله را تحلیل میکند. این کار با روشی به نام تحلیل مقاصد انجام میشود. به کمک مدلهای یادگیری ماشین، دستیار متوجه میشود که شما «گرفتن اطلاعات آبوهوا» را میخواهید و «امروز» به عنوان بازهٔ زمانی مشخص شده است.
دستیار به سرویس آبوهوا متصل شده، دمای فعلی را دریافت کرده و یک جمله مانند "دمای امروز تهران ۲۲ درجه و آسمان کمی ابری است" را میسازد. سپس با استفاده از موتور تبدیل متن به گفتار، این جمله را به صوت تبدیل و پخش میکند.
قلب هوشمند دستیار: مدلهای زبانی و یادگیری ماشین
بخش اصلی یک دستیار صوتی، مدل زبانی3 آن است. این مدل با دیدن میلیونها جمله و مکالمه، الگوهای زبانی را یاد میگیرد. یکی از مفاهیم پایه در این مدلها، احتمال وقوع یک کلمه پس از کلمات قبلی است. برای نمونه احتمال اینکه بعد از "هوا" کلمهٔ "ابرین است" بیاید، بسیار بیشتر از "ریاضی" است.
$ P(w_1, w_2, ..., w_n) = \prod_{i=1}^{n} P(w_i | w_1, w_2, ..., w_{i-1}) $
یعنی احتمال دیدن یک جمله، حاصل ضرب احتمال هر کلمه با داشتن کلمههای پیش از آن است. مدلهای زبانی پیشرفته مانند ترنسفورمر4 با معماری توجه، ارتباط بین کلمههای دور را هم تشخیص میدهند.
| نام دستیار | شرکت سازنده | قابلیت ویژه | نیاز به اینترنت |
|---|---|---|---|
| دستیار گوگل | گوگل | تشخیص مکالمهٔ طبیعی و چندمرحلهای | بله (بیشتر قابلیتها) |
| سیری | اپل | ادغام عمیق با سیستمعامل اپل | بله |
| الکسا | آمازون | کنترل دستگاههای خانهٔ هوشمند | بله |
کاربردهای روزمره: از پرسیدن ساعت تا کنترل خانهٔ هوشمند
دستیارهای صوتی وارد زندگی روزانه شدهاند. برخی از کاربردهای عملی آنها عبارتند از:
- اطلاعات عمومی: پرسیدن آبوهوا، اخبار، نتیجهٔ مسابقات ورزشی یا اطلاعات علمی سریع.
- یادآوری و برنامهریزی: تنظیم یادآور برای ملاقات پزشک، افزودن رویداد به تقویم یا تنظیم تایمر هنگام آشپزی.
- سرگرمی: پخش موسیقی، پادکست یا کتاب صوتی با فرمان صوتی.
- خانهٔ هوشمند: خاموش و روشن کردن چراغها، تنظیم دمای کولر یا قفل کردن درب ورودی.
- دسترسیپذیری: کمک به افراد دارای ناتوانی حرکتی یا بینایی برای کار با تلفن یا کامپیوتر.
چالشهای مفهومی: سه پرسش مهم دربارهٔ دستیارهای صوتی
پاسخ: دستیارهای صوتی با دادههای گفتاری آموزش میبینند. اگر در دادههای آموزشی نمونهٔ کافی از یک لهجه وجود نداشته باشد، تشخیص کلمات کاهش مییابد. همچنین روش تشخیص گفتار مبتنی بر واجهاست و لهجههای مختلف ممکن است واجها را به شکل متفاوتی تلفظ کنند.
پاسخ: بیشتر دستیارهای صوتی برای تشخیص گفتار و درک معنای جمله به سرورهای ابری قدرتمند متصل میشوند، زیرا مدلهای زبانی بزرگ روی پردازندهٔ گوشی جای نمیگیرند. اما امروزه برخی گوشیها قابلیت پردازش دروندستگاهی را برای دستورهای ساده (مانند تنظیم تایمر) فراهم کردهاند تا بدون اینترنت کار کنند.
پاسخ: بله، یکی از چالشهای اصلی همین است. دستیار برای فعال شدن باید همیشه به صدای محیط گوش دهد. برخی شرکتها مکالمات ضبطشده را برای بهبود مدلهای خود بررسی میکنند. راهکارهایی مانند غیرفعال کردن ضبط همیشگی، حذف دستی تاریخچهٔ صوتی و استفاده از حالت محلی میتواند خطر را کاهش دهد.
آیندهٔ دستیارهای صوتی: چه چیزهایی در راه است؟
پژوهشگران روی بهبود تشخیص عواطف از روی صدا، مکالمات طولانی و چندمرحلهای و حفظ بهتر بافت گفتگو کار میکنند. همچنین ترکیب دستیار صوتی با مدلهای زبانی بزرگ مانند مدلهای مولد، به آن امکان میدهد پاسخهای خلاقانهتر و دقیقتری بدهد. یکی از فرمولهای ارزیابی کیفیت تشخیص گفتار، نرخ خطای کلمه5 است:
که در آن S تعداد کلماتی است که اشتباه جانشین شدهاند، D تعداد حذفها، I تعداد درجهای اضافی و N کل کلمات صحیح است. هرچه WER کمتر باشد، دستیار بهتر صدا را تشخیص میدهد.
دستیارهای صوتی با تکیه بر پردازش گفتار، مدلهای زبانی و یادگیری ماشین، تعامل ما با فناوری را سادهتر کردهاند. از پرسیدن یک سوال ساده تا کنترل یک خانهٔ هوشمند، این برنامهها یاد میگیرند که کاربران را بهتر درک کنند. پیشرفت در حوزهٔ حفظ حریم خصوصی و تشخیص لهجهها میتواند آیندهٔ این فناوری را امیدبخشتر کند.
پاورقیها
2یادگیری ماشین: روشی که در آن الگوریتمها با دیدن دادههای زیاد، به صورت خودکار الگوها را شناسایی کرده و پیشبینی انجام میدهند. (معادل انگلیسی: Machine Learning)
3مدل زبانی: مدلی آماری که توزیع احتمال دنبالهای از کلمات را یاد میگیرد. (معادل انگلیسی: Language Model)
4ترنسفورمر: معماری شبکهٔ عصبی عمیق که پایهٔ بسیاری از مدلهای زبانی پیشرفته مانند GPT و BERT است. (معادل انگلیسی: Transformer)
5نرخ خطای کلمه: معیاری برای سنجش دقت سیستم تشخیص گفتار که درصد کلماتی را که اشتباه تشخیص داده شدهاند نشان میدهد. (معادل انگلیسی: Word Error Rate)