خانه
گاما

درسنامه آموزشی پودمان 2 هوش مصنوعی کلاس دهم هنرستان

واحد یادگیری داده‌ها و نقش آن در هوش مصنوعی

بازدید117
تاریخ بروزرسانی1404/09/6

آیا تا به حال به این اندیشیده‌اید؟

  • چگونه اپلیکیشن مسیریاب بهترین و خلوت‌ترین راه را برای رسیدن به مقصد به آن‌ها پیشنهاد می‌دهد؟ چطور حتی زمان رسیدن آن‌ها را به مقصد، با دقت بالایی تخمین می‌زند؟
  • چگونه وقتی در یک فروشگاه اینترنتی یک کالا را تماشا می‌کنید، کالاهای مشابه دیگری به آن‌ها پیشنهاد داده می‌شود؟

در پایان از هنرجو انتظار می‌رود

  • تفاوت میان داده، اطلاعات، دانش و خرد را با ذکر مثال تشخیص دهد.
  • انواع داده را براساس ساختار (ساختار یافته، نیمه‌ساختار یافته و بدون ساختار) طبقه‌بندی کند.
  • مراحل اصلی یک پایپ‌لاین داده (از جمع‌آوری تا ایجاد دادگان) را تشریح کند.
  • انواع مختلف دادگان (Dataset) مورد استفاده در هوش مصنوعی را شناسایی کند.
  • مفهوم کلان‌داده (Data Big) و ویژگی‌های اصلی آن را تشریح کند.

استاندارد عملکرد

هنرجو باید بتواند در پایان این بخش، درک عمیقی از مفهوم داده، انواع آن، فرایند آماده‌سازی آن و اهمیت حیاتی‌اش در ساخت و آموزش سامانه‌های هوشمند پیدا کند.

از داده تا خِرد: هرم دانش

هرم دانش، مدلی است که نشان می‌دهد چگونه داده‌های خام و بی‌معنی، طی فرایندی از پردازش و تحلیل، به اطلاعات، دانش و در نهایت به خردی عمیق و کاربردی تبدیل می‌شوند. هر سطح از این هرم، پایه‌ای برای سطح بالاتر از خود است. داده‌ها گاهی با کلمه دیتا نیز بیان می‌شوند.

هرم دانش، از داده‌های خام تا تصمیم‌گیری خردمندانه

الف) داده: داده‌ها (دیتاها)، حقایق خام، اعداد، نمادها و سیگنال‌هایی هستند که به تنهایی معنای خاصی ندارند و هیچ زمینه‌ای برای درک آن‌ها وجود ندارد. ویژگی داده‌ها به این شرح است:

1- بدون پاسخ به سؤال خاصی وجود دارند؛
2- ماهیت: اعداد، ارقام، حقایق خام؛
3- فرایند: مشاهده و جمع‌آوری.

ب) اطلاعات: داده‌هایی هستند که پردازش شده، در یک بستر مشخص قرار گرفته و معنادار شده‌اند. در این مرحله، به داده‌ها مفهوم و ارتباط بخشیده می‌شود. ویژگی اطلاعات به این شرح است:

1- پاسخ به سؤالات: «چه کسی؟ چه چیزی؟ چه زمانی؟ کجا؟»؛
2- ماهیت: داده‌های مرتبط و معنادار؛
3- فرایند: دسته‌بندی، محاسبه و مرتبط‌سازی داده‌ها.

ج) دانش: دانش از اطلاعات سازمان‌یافته به‌دست می‌آید و به ما توانایی درک الگوها و پیش‌بینی نتایج را می‌دهد. دانش، اطلاعات را کاربردی می‌کند. ویژگی‌های دانش به این شرح است:

1- پاسخ به سؤالات: چگونه؟؛
2- ماهیت: الگوها، روندها، استراتژی‌ها؛
3- فرایند: تحلیل و ترکیب اطلاعات.

د) خرد: خرد، بالاترین سطح از فهم و آگاهی است. در این مرحله، از دانش برای قضاوت، تصمیم‌گیری‌های استراتژیک و درک اصول بنیادین استفاده می‌شود. خرد کمک می‌کند تا بهترین اقدام در آینده انتخاب شود. ویژگی‌های مفاهیم در قالب خرد به این شرح است:

1- پاسخ به سؤالات: چرا؟؛
2- ماهیت: اصول، قضاوت، بصیرت، اخلاق؛
3- فرایند: تأمل و درک عمیق دانش.

فعالیت (صفحهٔ 46 کتاب درسی)

 

فرض کنید مجموعه‌ای از داده‌های یک مدرسه که شامل داده‌های مربوط به هنرجویان، هنرآموزان، درس‌ها، کلاس‌های درس و امتحانات است در اختیار دارید. دو نمونه از مواردی که در این داده‌ها ذخیره می‌شود را انتخاب و برای هرکدام داده، اطلاعات، دانش و خرد مربوطه را بنویسید.

ساختار داده‌ها چه شکلی است؟

داده‌ها در دنیای ما به شکل‌های مختلفی وجود دارند. شناخت ساختار آن‌ها برای انتخاب ابزار مناسب برای پردازش آن‌ها ضروری است. این داده‌ها به سه دسته ساختاریافته، بدون ساختار و نیمه ساختاریافته دسته‌بندی می‌شوند. (شکل زیر)

1- داده‌های ساختاریافته: این داده‌ها پادشاه نظم هستند. آن‌ها در یک مدل از پیش تعریف‌شده، معمولاً جدول‌هایی با سطرها و ستون‌های ثابت، قرار دارند. هر ستون یک ویژگی خاص (مثل نام یا قیمت) و هر سطر یک نمونه واحد (مثل یک مشتری یا یک محصول) را نشان می‌دهد.

انواع داده‌ها

2- داده‌های بدون ساختار: این‌ها داده‌های دنیای واقعی و اغلب انسانی هستند. هیچ ساختار مشخصی ندارند و نمی‌توان آن‌ها را به‌راحتی در یک جدول قرار داد. تحلیل این داده‌ها برای ماشین‌ها بسیار چالش‌ برانگیزتر است اما گنجینه‌ای از اطلاعات را در خود پنهان کرده‌اند.

3- داده‌های نیمه‌ساختاریافته: این داده‌ها کاملاً بی‌نظم نیستند، اما در قالب جدول‌های سفت و سخت هم قرار نمی‌گیرند. آن‌ها از «برچسب‌ها» یا «تگ‌ها» برای جداسازی و سازماندهی عناصر داده استفاده می‌کنند.

فعالیت (صفحهٔ 47 کتاب درسی)

 

گروه‌های دو نفره تشکیل دهید؛ سه مثال برای هر یک از انواع داده (ساختاریافته، بدون ساختار و نیمه‌ساختاریافته) از اپلیکیشن‌ها و وب‌سایت‌هایی که روزانه استفاده می‌کنید، پیدا کنید و در کلاس با دیگران به اشتراک بگذارید. مثلاً صفحه یک محصول در سایت‌های فروشگاهی چه نوع داده‌هایی دارد؟

خط لوله داده (سفر داده‌ها از آشپزخانه تا میز غذا)

مدل هوش مصنوعی، داده خام و نامرتب را دوست ندارد. درست مثل یک سرآشپز که قبل از پختن غذا، مواد اولیه را آماده می‌کند، به‌همین دلیل باید داده‌ها را طی یک فرایند چند مرحله‌ای به نام «خط لوله داده» مطابق (شکل زیر) آماده کرد. به این خط لوله داده در اصطلاح پایپ لاین دیتا یا داده گفته می‌شود. مراحل آماده‌سازی داده‌ها در چهار مرحله به این شرح است:

مراحل اصلی یک پایپ‌ لاین داده

1- جمع‌آوری

اولین قدم، به‌دست آوردن داده‌ها است. این کار می‌تواند از منابع مختلفی انجام شود:

  • حسگرها: جمع‌آوری دمای هوا از حسگرهای هواشناسی یا اطلاعات GPS از تلفن‌های همراه هوشمند؛
  • لاگ‌های کاربری: ثبت کلیک‌ها، جستجوها و فعالیت‌های کاربران در یک وب‌سایت یا اپلیکیشن؛
  • وب اسکرپینگ: استخراج خودکار اطلاعات از وب‌سایت‌ها (مثلاً جمع‌آوری قیمت و مشخصات تلفن‌های همراه یا تبلت از چندین فروشگاه آنلاین)؛
  • نظرسنجی و فرم‌ها: دریافت مستقیم اطلاعات از کاربران.

2- ذخیره‌سازی

داده‌های جمع‌آوری شده باید در جایی امن و قابل دسترس ذخیره شوند. دخیره‌سازی به نوع و حجم داده بستگی دارد و برای انجام آن، از ابزارهای مختلفی استفاده می‌شود؛ از فایل‌های ساده (مثل CSV یا Excel) گرفته تا پایگاه‌های داده پیچیده و دریاچه‌های داده برای کلان‌داده استفاده می‌شود.

3- پاک‌سازی

این مرحله یکی از مهم‌ترین و زمان‌برترین مراحل است. داده‌های دنیای واقعی کثیف و نامرتب هستند. پاک‌سازی داده‌ها شامل این مراحل است:

  • حذف موارد تکراری: پاک کردن رکوردهایی که به اشتباه دو بار ثبت شده‌اند؛
  • اصلاح خطاها: تصحیح اشتباهات تایپی (مثلاً تبدیل «طهران» به «تهران»)؛
  • مدیریت مقادیر گمشده: تصمیم‌گیری در مورد داده‌هایی که وجود ندارند. مثلاً اگر سن یک کاربر ثبت نشده، آیا باید آن کاربر را حذف کرد یا سن او را با میانگین سن بقیه کاربران در نظر گرفت؟

اصل معروفی در هوش مصنوعی وجود دارد: ورودی زباله به سامانه، خروجی زباله به همراه خواهد داشت (اگر داده‌های بی‌کیفیت به مدل داده شود، بهترین مدل هوش مصنوعی هم نتایج بی‌کیفیتی تولید خواهد کرد). برای برخی از کاربردها و در برخی از مدل‌سازی‌ها پس از پاک‌سازی، باید عملیات برچسب‌زنی اتفاق بیفتد.

در این مرحله، به داده‌ها «برچسب» یا «پاسخ صحیح» اضافه شود. این کار اغلب به‌صورت دستی توسط انسان انجام می‌شود. مثال: هزاران عکس از حیوانات مشاهده کنید و برای هرکدام مشخص کنید که این عکس «گربه» یا «سگ» است یا در یک متن، کلمات کلیدی را مشخص کنید. فعالیت در بخش‌های بعدی این کتاب به‌عنوان یک کار انجام شود.

4- ایجاد مجموعه داده

داده‌های پاک و برچسب‌گذاری شده در نهایت، به سه بخش تقسیم می‌شود تا بتوان مدل را به‌درستی آموزش داد و ارزیابی کرد:

  • دادگان آموزش: بزرگ‌ترین بخش داده (معمولاً 80٪ ـ 70٪) که برای آموزش دادن مدل و یادگیری الگوها استفاده می‌شود. کتاب درسی یکی از نمونه‌های مناسب برای دادگان آموزشی است.
  • دادگان اعتبارسنجی: بخش کوچکی از داده (15٪ ـ 10٪) که در حین فرایند آموزش استفاده می‌شود تا عملکرد مدل سنجیده شود و تنظیمات آن را بهینه کند. ارزشیابی‌های مستمر، نمونه‌ای از دادگان اعتبارسنجی است.
  • دادگان آزمون بخش نهایی: داده (15٪ ـ 10٪) که مدل تا به حال آن را ندیده است. از این بخش فقط در انتهای کار برای ارزیابی نهایی عملکرد مدل استفاده می‌شود. ارزشیابی‌های پایانی نمونه‌ای از این دادگان آزمون است.

دسته‌بندی ایجاد مجموعه داده در شکل زیر نشان داده شده است.

تقسیم‌بندی مجموعه داده

انواع دادگان در هوش مصنوعی

دادگان نقش کتاب‌های آموزشی را در موضوع هوش مصنوعی دارند. هر نوع مسئله‌ای، کتاب آموزشی مخصوص به خود را نیاز دارد. به نمونه‌ای از دادگان متنوع در ادامه اشاره شده است:

  • صوت و سیگنال: شامل فایل‌های صوتی. علاوه‌بر دستیارهای صوتی، در پزشکی برای تحلیل صدای قلب یا ریه نیز کاربرد دارد.
  • متن: هر نوع داده نوشتاری برای تحلیل احساسات، نظرات کاربران، ساخت سامانه‌های پرسش و پاسخ یا حتی نوشتن شعر و داستان توسط هوش مصنوعی استفاده می‌شود.
  • تصویر و ویدئو: عکس‌ها و فیلم‌ها. برای کنترل کیفیت در کارخانه‌ها (تشخیص محصولات معیوب روی نوار نقاله) یا در کشاورزی هوشمند (تشخیص بیماری گیاهان از روی عکس برگ‌ها) به‌کار می‌رود.
  • داده‌های جدولی: همان داده‌های ساختاریافته هستند که ستون فقرات بسیاری از کسب‌وکارها برای پیش‌بینی فروش، مدیریت ریسک و تحلیل مشتریان و کاربردهای دیگر به حساب می‌آیند.
  • داده‌های سری زمانی: داده‌هایی که در طول زمان ثبت می‌شوند. برای تحلیل داده‌های حسگرهای یک دستگاه صنعتی برای پیش‌بینی زمان خرابی آن یا تحلیل الگوهای ترافیک شهری استفاده می‌شود.
  • گراف: برای نمایش ارتباطات. در شیمی برای کشف داروهای جدید (تحلیل ساختار مولکولی) یا در حمل و نقل برای یافتن بهینه‌ترین مسیر توزیع کالا استفاده می‌شود.
  • دادگان ترکیبی: در دنیای امروز، اکثر سامانه‌های پیشرفته از ترکیب این داده‌ها استفاده می‌کنند تا درک کامل‌تری از محیط به‌دست آورند. یک خودروی خودران همزمان از داده‌های ویدئویی (دوربین‌ها)، داده‌های سیگنال (رادار و لایدار) و داده‌های گراف (نقشه) استفاده می‌کند.

دسته‌بندی دادگان‌ها در هوش مصنوعی در شکل زیر نشان داده شده است.

انواع داده در هوش مصنوعی

کلان‌داده

وقتی داده‌ها تبدیل به یک اقیانوس داده می‌شود.

کلان‌داده به مجموعه‌ای از داده‌ها اطلاق می‌شود که به دلیل حجم، سرعت یا تنوع فوق‌العاده بالا، با ابزارهای سنتی قابل مدیریت، ذخیره و پردازش نیستند. کلان‌داده معمولاً با پنج وی، (5V) توصیف می‌شود که اصطلاحاً به آن‌ها Big data گفته می‌شود.

1- حجم (Volume): مقدار داده بسیار زیاد است (پتابایت و فراتر).
مثال: داده‌های تولید شده توسط تلسکوپ‌های فضایی در یک روز.

2- سرعت (Velocity): داده‌ها با سرعت بسیار بالایی تولید و منتقل می‌شوند.
مثال: داده‌های لحظه‌ای بازار بورس یا میلیون‌ها توییتی که در هر دقیقه ارسال می‌شوند.

3- تنوع (Varity): داده‌ها از انواع مختلف ساختاریافته، نیمه‌ساختاریافته و بدون ساختار هستند.
مثال: داده‌های یک بیمار در بیمارستان شامل سوابق پزشکی جدولی، تصاویر رادیولوژی بدون ساختار و یادداشت‌های نیمه‌ساختاریافته پرستاران.

4- صحت (Variable): به معنای عدم قطعیت و میزان قابل اعتماد بودن داده‌ها است. آیا داده‌ها تمیز و دقیق هستند یا پر از خطا، نویز و اطلاعات نادرست است؟
مثال: تفاوت بین اخبار منتشر شده از یک خبرگزاری معتبر با شایعات پخش شده در شبکه‌های اجتماعی. مدیریت صحت داده‌ها یک چالش بزرگ است.

5- ارزش (Value): مهم‌ترین ویژگی، آیا می‌توان از این حجم عظیم داده، اطلاعات ارزشمند و قابل استفاده‌ای استخراج کرد؟ داشتن کوهی از داده‌های بی‌ارزش هیچ فایده‌ای ندارد. هدف نهایی، تبدیل کلان‌داده به ارزش تجاری یا علمی است. ویژگی‌های اصلی (5V) داده‌های کلان یا big data در شکل زیر نشان داده شده است.

پنج ویژگی اصلی کلان‌داده‌ها (big data)

فعالیت (صفحهٔ 51 کتاب درسی)

 

در خصوص واحد اندازه‌گیری داده‌ها یعنی بایت تحقیق کنید. مفهوم آن را بنویسید و بگویید ترتیب افزایش واحدهای حجم (برای مثال ترابایت، مگابایت و...) به چه شکل است. نمونه‌هایی از کلان‌داده‌هارا نام ببرید.

اهمیت داده‌ها در هوش مصنوعی

برای بررسی اهمیت این موضوع در هوش مصنوعی باید ابتدا به یک سؤال پاسخ داد:

چرا داده برای هوش مصنوعی این‌قدر مهم است؟
پاسخ کوتاه: داده، معلم و تجربه هوش مصنوعی است و به نوعی از داده یاد می‌گیرد.

یک مدل هوش مصنوعی بدون داده، مانند یک مغز قدرتمند، ولی بدون هیچ اطلاعاتی است؛ این مغز ظرفیت بالایی برای پردازش دارد، اما هیچ چیز برای یادگیری در اختیار او نیست.

داده‌ها الگوها را آشکار می‌کنند: یک سامانه هوش مصنوعی با تحلیل داده‌های آب و هوایی چند دهه، یاد می‌گیرد که ترکیب خاصی از فشار هوا، رطوبت و جهت باد معمولاً منجر به بارندگی می‌شود. او قوانین فیزیک را نمی‌داند، بلکه الگوها را از داده‌ها یاد گرفته است.

کیفیت و کمیت داده‌ها حرف اول را می‌زند: هرچه داده‌های آموزشی بیشتر، متنوع‌تر و باکیفیت‌تر باشند، مدل هوش مصنوعی ما دقیق‌تر، قوی‌تر و قابل اعتمادتر خواهد بود. اگر یک مدل تشخیص چهره را فقط با عکس‌هایی که در نور روز گرفته شده‌اند آموزش دهیم، در شب عملکرد بسیار ضعیفی خواهد داشت. به‌همین دلیل تنوع داده‌ها حیاتی است.

بنابراین می‌توان در جمع‌بندی گفت، سامانه هوش مصنوعی، تجربه زیسته خود را از داده‌ها کسب می‌کند. داده‌ها دسته‌بندی و مرتب می‌شود و با تشکیل مدل و الگو موجب یادگیری در ماشین می‌شود و در تجربه‌های بعدی از آن استفاده می‌کند.

از داده تا یادگیری ماشین
پودمان 2: مدل‌سازی هوش مصنوعی