درسنامه آموزشی پودمان 2 هوش مصنوعی کلاس دهم هنرستان
واحد یادگیری دادهها و نقش آن در هوش مصنوعی
آیا تا به حال به این اندیشیدهاید؟
- چگونه اپلیکیشن مسیریاب بهترین و خلوتترین راه را برای رسیدن به مقصد به آنها پیشنهاد میدهد؟ چطور حتی زمان رسیدن آنها را به مقصد، با دقت بالایی تخمین میزند؟
- چگونه وقتی در یک فروشگاه اینترنتی یک کالا را تماشا میکنید، کالاهای مشابه دیگری به آنها پیشنهاد داده میشود؟
در پایان از هنرجو انتظار میرود
- تفاوت میان داده، اطلاعات، دانش و خرد را با ذکر مثال تشخیص دهد.
- انواع داده را براساس ساختار (ساختار یافته، نیمهساختار یافته و بدون ساختار) طبقهبندی کند.
- مراحل اصلی یک پایپلاین داده (از جمعآوری تا ایجاد دادگان) را تشریح کند.
- انواع مختلف دادگان (Dataset) مورد استفاده در هوش مصنوعی را شناسایی کند.
- مفهوم کلانداده (Data Big) و ویژگیهای اصلی آن را تشریح کند.
استاندارد عملکرد
هنرجو باید بتواند در پایان این بخش، درک عمیقی از مفهوم داده، انواع آن، فرایند آمادهسازی آن و اهمیت حیاتیاش در ساخت و آموزش سامانههای هوشمند پیدا کند.
از داده تا خِرد: هرم دانش
هرم دانش، مدلی است که نشان میدهد چگونه دادههای خام و بیمعنی، طی فرایندی از پردازش و تحلیل، به اطلاعات، دانش و در نهایت به خردی عمیق و کاربردی تبدیل میشوند. هر سطح از این هرم، پایهای برای سطح بالاتر از خود است. دادهها گاهی با کلمه دیتا نیز بیان میشوند.
الف) داده: دادهها (دیتاها)، حقایق خام، اعداد، نمادها و سیگنالهایی هستند که به تنهایی معنای خاصی ندارند و هیچ زمینهای برای درک آنها وجود ندارد. ویژگی دادهها به این شرح است:
1- بدون پاسخ به سؤال خاصی وجود دارند؛
2- ماهیت: اعداد، ارقام، حقایق خام؛
3- فرایند: مشاهده و جمعآوری.
ب) اطلاعات: دادههایی هستند که پردازش شده، در یک بستر مشخص قرار گرفته و معنادار شدهاند. در این مرحله، به دادهها مفهوم و ارتباط بخشیده میشود. ویژگی اطلاعات به این شرح است:
1- پاسخ به سؤالات: «چه کسی؟ چه چیزی؟ چه زمانی؟ کجا؟»؛
2- ماهیت: دادههای مرتبط و معنادار؛
3- فرایند: دستهبندی، محاسبه و مرتبطسازی دادهها.
ج) دانش: دانش از اطلاعات سازمانیافته بهدست میآید و به ما توانایی درک الگوها و پیشبینی نتایج را میدهد. دانش، اطلاعات را کاربردی میکند. ویژگیهای دانش به این شرح است:
1- پاسخ به سؤالات: چگونه؟؛
2- ماهیت: الگوها، روندها، استراتژیها؛
3- فرایند: تحلیل و ترکیب اطلاعات.
د) خرد: خرد، بالاترین سطح از فهم و آگاهی است. در این مرحله، از دانش برای قضاوت، تصمیمگیریهای استراتژیک و درک اصول بنیادین استفاده میشود. خرد کمک میکند تا بهترین اقدام در آینده انتخاب شود. ویژگیهای مفاهیم در قالب خرد به این شرح است:
1- پاسخ به سؤالات: چرا؟؛
2- ماهیت: اصول، قضاوت، بصیرت، اخلاق؛
3- فرایند: تأمل و درک عمیق دانش.
فعالیت (صفحهٔ 46 کتاب درسی)
فرض کنید مجموعهای از دادههای یک مدرسه که شامل دادههای مربوط به هنرجویان، هنرآموزان، درسها، کلاسهای درس و امتحانات است در اختیار دارید. دو نمونه از مواردی که در این دادهها ذخیره میشود را انتخاب و برای هرکدام داده، اطلاعات، دانش و خرد مربوطه را بنویسید.
ساختار دادهها چه شکلی است؟
دادهها در دنیای ما به شکلهای مختلفی وجود دارند. شناخت ساختار آنها برای انتخاب ابزار مناسب برای پردازش آنها ضروری است. این دادهها به سه دسته ساختاریافته، بدون ساختار و نیمه ساختاریافته دستهبندی میشوند. (شکل زیر)
1- دادههای ساختاریافته: این دادهها پادشاه نظم هستند. آنها در یک مدل از پیش تعریفشده، معمولاً جدولهایی با سطرها و ستونهای ثابت، قرار دارند. هر ستون یک ویژگی خاص (مثل نام یا قیمت) و هر سطر یک نمونه واحد (مثل یک مشتری یا یک محصول) را نشان میدهد.
2- دادههای بدون ساختار: اینها دادههای دنیای واقعی و اغلب انسانی هستند. هیچ ساختار مشخصی ندارند و نمیتوان آنها را بهراحتی در یک جدول قرار داد. تحلیل این دادهها برای ماشینها بسیار چالش برانگیزتر است اما گنجینهای از اطلاعات را در خود پنهان کردهاند.
3- دادههای نیمهساختاریافته: این دادهها کاملاً بینظم نیستند، اما در قالب جدولهای سفت و سخت هم قرار نمیگیرند. آنها از «برچسبها» یا «تگها» برای جداسازی و سازماندهی عناصر داده استفاده میکنند.
فعالیت (صفحهٔ 47 کتاب درسی)
گروههای دو نفره تشکیل دهید؛ سه مثال برای هر یک از انواع داده (ساختاریافته، بدون ساختار و نیمهساختاریافته) از اپلیکیشنها و وبسایتهایی که روزانه استفاده میکنید، پیدا کنید و در کلاس با دیگران به اشتراک بگذارید. مثلاً صفحه یک محصول در سایتهای فروشگاهی چه نوع دادههایی دارد؟
خط لوله داده (سفر دادهها از آشپزخانه تا میز غذا)
مدل هوش مصنوعی، داده خام و نامرتب را دوست ندارد. درست مثل یک سرآشپز که قبل از پختن غذا، مواد اولیه را آماده میکند، بههمین دلیل باید دادهها را طی یک فرایند چند مرحلهای به نام «خط لوله داده» مطابق (شکل زیر) آماده کرد. به این خط لوله داده در اصطلاح پایپ لاین دیتا یا داده گفته میشود. مراحل آمادهسازی دادهها در چهار مرحله به این شرح است:
1- جمعآوری
اولین قدم، بهدست آوردن دادهها است. این کار میتواند از منابع مختلفی انجام شود:
- حسگرها: جمعآوری دمای هوا از حسگرهای هواشناسی یا اطلاعات GPS از تلفنهای همراه هوشمند؛
- لاگهای کاربری: ثبت کلیکها، جستجوها و فعالیتهای کاربران در یک وبسایت یا اپلیکیشن؛
- وب اسکرپینگ: استخراج خودکار اطلاعات از وبسایتها (مثلاً جمعآوری قیمت و مشخصات تلفنهای همراه یا تبلت از چندین فروشگاه آنلاین)؛
- نظرسنجی و فرمها: دریافت مستقیم اطلاعات از کاربران.
2- ذخیرهسازی
دادههای جمعآوری شده باید در جایی امن و قابل دسترس ذخیره شوند. دخیرهسازی به نوع و حجم داده بستگی دارد و برای انجام آن، از ابزارهای مختلفی استفاده میشود؛ از فایلهای ساده (مثل CSV یا Excel) گرفته تا پایگاههای داده پیچیده و دریاچههای داده برای کلانداده استفاده میشود.
3- پاکسازی
این مرحله یکی از مهمترین و زمانبرترین مراحل است. دادههای دنیای واقعی کثیف و نامرتب هستند. پاکسازی دادهها شامل این مراحل است:
- حذف موارد تکراری: پاک کردن رکوردهایی که به اشتباه دو بار ثبت شدهاند؛
- اصلاح خطاها: تصحیح اشتباهات تایپی (مثلاً تبدیل «طهران» به «تهران»)؛
- مدیریت مقادیر گمشده: تصمیمگیری در مورد دادههایی که وجود ندارند. مثلاً اگر سن یک کاربر ثبت نشده، آیا باید آن کاربر را حذف کرد یا سن او را با میانگین سن بقیه کاربران در نظر گرفت؟
اصل معروفی در هوش مصنوعی وجود دارد: ورودی زباله به سامانه، خروجی زباله به همراه خواهد داشت (اگر دادههای بیکیفیت به مدل داده شود، بهترین مدل هوش مصنوعی هم نتایج بیکیفیتی تولید خواهد کرد). برای برخی از کاربردها و در برخی از مدلسازیها پس از پاکسازی، باید عملیات برچسبزنی اتفاق بیفتد.
در این مرحله، به دادهها «برچسب» یا «پاسخ صحیح» اضافه شود. این کار اغلب بهصورت دستی توسط انسان انجام میشود. مثال: هزاران عکس از حیوانات مشاهده کنید و برای هرکدام مشخص کنید که این عکس «گربه» یا «سگ» است یا در یک متن، کلمات کلیدی را مشخص کنید. فعالیت در بخشهای بعدی این کتاب بهعنوان یک کار انجام شود.
4- ایجاد مجموعه داده
دادههای پاک و برچسبگذاری شده در نهایت، به سه بخش تقسیم میشود تا بتوان مدل را بهدرستی آموزش داد و ارزیابی کرد:
- دادگان آموزش: بزرگترین بخش داده (معمولاً 80٪ ـ 70٪) که برای آموزش دادن مدل و یادگیری الگوها استفاده میشود. کتاب درسی یکی از نمونههای مناسب برای دادگان آموزشی است.
- دادگان اعتبارسنجی: بخش کوچکی از داده (15٪ ـ 10٪) که در حین فرایند آموزش استفاده میشود تا عملکرد مدل سنجیده شود و تنظیمات آن را بهینه کند. ارزشیابیهای مستمر، نمونهای از دادگان اعتبارسنجی است.
- دادگان آزمون بخش نهایی: داده (15٪ ـ 10٪) که مدل تا به حال آن را ندیده است. از این بخش فقط در انتهای کار برای ارزیابی نهایی عملکرد مدل استفاده میشود. ارزشیابیهای پایانی نمونهای از این دادگان آزمون است.
دستهبندی ایجاد مجموعه داده در شکل زیر نشان داده شده است.
انواع دادگان در هوش مصنوعی
دادگان نقش کتابهای آموزشی را در موضوع هوش مصنوعی دارند. هر نوع مسئلهای، کتاب آموزشی مخصوص به خود را نیاز دارد. به نمونهای از دادگان متنوع در ادامه اشاره شده است:
- صوت و سیگنال: شامل فایلهای صوتی. علاوهبر دستیارهای صوتی، در پزشکی برای تحلیل صدای قلب یا ریه نیز کاربرد دارد.
- متن: هر نوع داده نوشتاری برای تحلیل احساسات، نظرات کاربران، ساخت سامانههای پرسش و پاسخ یا حتی نوشتن شعر و داستان توسط هوش مصنوعی استفاده میشود.
- تصویر و ویدئو: عکسها و فیلمها. برای کنترل کیفیت در کارخانهها (تشخیص محصولات معیوب روی نوار نقاله) یا در کشاورزی هوشمند (تشخیص بیماری گیاهان از روی عکس برگها) بهکار میرود.
- دادههای جدولی: همان دادههای ساختاریافته هستند که ستون فقرات بسیاری از کسبوکارها برای پیشبینی فروش، مدیریت ریسک و تحلیل مشتریان و کاربردهای دیگر به حساب میآیند.
- دادههای سری زمانی: دادههایی که در طول زمان ثبت میشوند. برای تحلیل دادههای حسگرهای یک دستگاه صنعتی برای پیشبینی زمان خرابی آن یا تحلیل الگوهای ترافیک شهری استفاده میشود.
- گراف: برای نمایش ارتباطات. در شیمی برای کشف داروهای جدید (تحلیل ساختار مولکولی) یا در حمل و نقل برای یافتن بهینهترین مسیر توزیع کالا استفاده میشود.
- دادگان ترکیبی: در دنیای امروز، اکثر سامانههای پیشرفته از ترکیب این دادهها استفاده میکنند تا درک کاملتری از محیط بهدست آورند. یک خودروی خودران همزمان از دادههای ویدئویی (دوربینها)، دادههای سیگنال (رادار و لایدار) و دادههای گراف (نقشه) استفاده میکند.
دستهبندی دادگانها در هوش مصنوعی در شکل زیر نشان داده شده است.
کلانداده
وقتی دادهها تبدیل به یک اقیانوس داده میشود.
کلانداده به مجموعهای از دادهها اطلاق میشود که به دلیل حجم، سرعت یا تنوع فوقالعاده بالا، با ابزارهای سنتی قابل مدیریت، ذخیره و پردازش نیستند. کلانداده معمولاً با پنج وی، (5V) توصیف میشود که اصطلاحاً به آنها Big data گفته میشود.
1- حجم (Volume): مقدار داده بسیار زیاد است (پتابایت و فراتر).
مثال: دادههای تولید شده توسط تلسکوپهای فضایی در یک روز.
2- سرعت (Velocity): دادهها با سرعت بسیار بالایی تولید و منتقل میشوند.
مثال: دادههای لحظهای بازار بورس یا میلیونها توییتی که در هر دقیقه ارسال میشوند.
3- تنوع (Varity): دادهها از انواع مختلف ساختاریافته، نیمهساختاریافته و بدون ساختار هستند.
مثال: دادههای یک بیمار در بیمارستان شامل سوابق پزشکی جدولی، تصاویر رادیولوژی بدون ساختار و یادداشتهای نیمهساختاریافته پرستاران.
4- صحت (Variable): به معنای عدم قطعیت و میزان قابل اعتماد بودن دادهها است. آیا دادهها تمیز و دقیق هستند یا پر از خطا، نویز و اطلاعات نادرست است؟
مثال: تفاوت بین اخبار منتشر شده از یک خبرگزاری معتبر با شایعات پخش شده در شبکههای اجتماعی. مدیریت صحت دادهها یک چالش بزرگ است.
5- ارزش (Value): مهمترین ویژگی، آیا میتوان از این حجم عظیم داده، اطلاعات ارزشمند و قابل استفادهای استخراج کرد؟ داشتن کوهی از دادههای بیارزش هیچ فایدهای ندارد. هدف نهایی، تبدیل کلانداده به ارزش تجاری یا علمی است. ویژگیهای اصلی (5V) دادههای کلان یا big data در شکل زیر نشان داده شده است.
فعالیت (صفحهٔ 51 کتاب درسی)
در خصوص واحد اندازهگیری دادهها یعنی بایت تحقیق کنید. مفهوم آن را بنویسید و بگویید ترتیب افزایش واحدهای حجم (برای مثال ترابایت، مگابایت و...) به چه شکل است. نمونههایی از کلاندادههارا نام ببرید.
اهمیت دادهها در هوش مصنوعی
برای بررسی اهمیت این موضوع در هوش مصنوعی باید ابتدا به یک سؤال پاسخ داد:
چرا داده برای هوش مصنوعی اینقدر مهم است؟
پاسخ کوتاه: داده، معلم و تجربه هوش مصنوعی است و به نوعی از داده یاد میگیرد.
یک مدل هوش مصنوعی بدون داده، مانند یک مغز قدرتمند، ولی بدون هیچ اطلاعاتی است؛ این مغز ظرفیت بالایی برای پردازش دارد، اما هیچ چیز برای یادگیری در اختیار او نیست.
دادهها الگوها را آشکار میکنند: یک سامانه هوش مصنوعی با تحلیل دادههای آب و هوایی چند دهه، یاد میگیرد که ترکیب خاصی از فشار هوا، رطوبت و جهت باد معمولاً منجر به بارندگی میشود. او قوانین فیزیک را نمیداند، بلکه الگوها را از دادهها یاد گرفته است.
کیفیت و کمیت دادهها حرف اول را میزند: هرچه دادههای آموزشی بیشتر، متنوعتر و باکیفیتتر باشند، مدل هوش مصنوعی ما دقیقتر، قویتر و قابل اعتمادتر خواهد بود. اگر یک مدل تشخیص چهره را فقط با عکسهایی که در نور روز گرفته شدهاند آموزش دهیم، در شب عملکرد بسیار ضعیفی خواهد داشت. بههمین دلیل تنوع دادهها حیاتی است.
بنابراین میتوان در جمعبندی گفت، سامانه هوش مصنوعی، تجربه زیسته خود را از دادهها کسب میکند. دادهها دستهبندی و مرتب میشود و با تشکیل مدل و الگو موجب یادگیری در ماشین میشود و در تجربههای بعدی از آن استفاده میکند.