۱۸ معیار ETSI برای سنجش کیفیت داده و اعتمادپذیری هوش مصنوعی
۱۸ معیار ETSI برای سنجش کیفیت داده در هوش مصنوعی را بشناسید؛ از دقت و کامل بودن داده تا سوگیری، ناشناسسازی، ردیابی و محرمانگی.
هر سیستم هوش مصنوعی به اندازه دادههایی که با آنها آموزش میبیند و کار میکند قابل اعتماد است. اما چگونه میتوان پیش از استفاده از یک مجموعه داده، کیفیت و قابلیت اعتماد آن را بهصورت عینی اندازهگیری کرد؟
مؤسسه استانداردهای ارتباطات اروپا (ETSI) برای پاسخ به همین پرسش، گزارش فنی ETSI TR 104 180 را منتشر کرده است. این گزارش یک چارچوب استاندارد برای ارزیابی کمی کیفیت داده ارائه میکند و شامل ۱۸ معیار مشخص برای بررسی کیفیت، قابلیت اعتماد، سوگیری و حریم خصوصی دادههاست. برای هر معیار نیز تعریف رسمی و روشهای ریاضی اندازهگیری ارائه شده است.
ETSI میگوید این چارچوب به سازمانها کمک میکند مشخص کنند آیا یک مجموعه داده برای هدف موردنظر، بهویژه استفاده در اکوسیستمهای هوش مصنوعی، بهاندازه کافی قابل اعتماد و مناسب است یا خیر.
۱۸ معیار کیفیت داده در ETSI TR 104 180 چیست؟
این ۱۸ معیار در چهار گروه اصلی قرار میگیرند: کیفیت بنیادی داده، قابلیت استفاده، عدالت و حریم خصوصی.
۱. کامل بودن (Completeness)
کامل بودن نشان میدهد چه میزان از اطلاعات موردنیاز در یک مجموعه داده وجود دارد و چه مقدار از دادهها ناقص یا خالی هستند.
برای مثال، اگر یک پایگاه داده مشتریان شامل نام و شماره تلفن ۹۵ درصد افراد باشد اما اطلاعات ۵ درصد دیگر ناقص باشد، این مسئله میتواند بر کیفیت تحلیل یا عملکرد مدل هوش مصنوعی تأثیر بگذارد.
هرچه اطلاعات ضروری بیشتری در مجموعه داده موجود باشد، امتیاز کامل بودن بالاتر خواهد بود.
۲. دقت (Accuracy)
دقت بررسی میکند که مقادیر ثبتشده تا چه اندازه با مقدار واقعی یا مورد انتظار مطابقت دارند.
وجود دادههای اشتباه میتواند حتی در یک مجموعه داده بزرگ، نتیجه مدل هوش مصنوعی را منحرف کند. بنابراین حجم بالای داده بهتنهایی نشانه کیفیت نیست؛ داده باید تا حد امکان صحیح و مطابق واقعیت باشد.
۳. قابلیت اطمینان (Reliability)
قابلیت اطمینان به این موضوع میپردازد که آیا دادهها در شرایط مختلف و در طول زمان میتوانند نتایج قابل اتکایی ارائه دهند یا خیر.
این معیار بهخصوص برای دادههای حسگرها و سامانههای صنعتی اهمیت دارد؛ جایی که دادههای ناپایدار یا غیرقابل اعتماد میتوانند مستقیماً بر تصمیمگیری سیستم تأثیر بگذارند.
۴. سازگاری (Consistency)
سازگاری بررسی میکند که دادهها در بخشها، منابع یا مجموعههای مختلف با یکدیگر تناقض نداشته باشند.
برای نمونه، اگر تاریخ تولد یک فرد در دو پایگاه داده متفاوت ثبت شده باشد، وجود این اختلاف میتواند نشانه پایین بودن سازگاری دادهها باشد.
۵. دقت اندازهگیری (Precision)
Precision با Accuracy یکسان نیست. در این معیار، تمرکز بر سطح جزئیات و میزان دقیق بودن مقدار ثبتشده است.
برای مثال، ثبت دمای یک محیط بهصورت «۲۵ درجه» نسبت به ثبت «۲۵٫۳۷ درجه» سطح متفاوتی از Precision دارد. میزان دقت موردنیاز نیز به کاربرد داده بستگی دارد.
۶. یکپارچگی (Integrity)
یکپارچگی بررسی میکند که دادهها در طول چرخه عمر خود دستکاری، تخریب یا به شکل نامناسب تغییر نکرده باشند.
در سیستمهایی که داده از منابع متعدد دریافت و منتقل میشود، حفظ یکپارچگی اهمیت زیادی دارد؛ زیرا تغییر ناخواسته داده میتواند اعتبار نتایج حاصل از آن را زیر سؤال ببرد.
۷. افزونگی (Redundancy)
افزونگی به وجود دادههای تکراری یا اطلاعاتی اشاره دارد که بیش از حد موردنیاز در مجموعه داده وجود دارند.
دادههای تکراری میتوانند حجم ذخیرهسازی را افزایش دهند و در برخی کاربردها باعث شوند مدل هوش مصنوعی وزن بیشتری به یک نمونه یا گروه خاص بدهد.
البته افزونگی همیشه به معنای «بد بودن» داده نیست و باید با توجه به هدف مجموعه داده ارزیابی شود.
۸. یکتایی (Uniqueness)
یکتایی بررسی میکند که آیا رکوردهای یک مجموعه داده واقعاً منحصربهفرد هستند یا نمونههای تکراری در آن وجود دارد.
برای مثال، اگر یک مشتری چند بار بهعنوان رکوردهای جداگانه در یک پایگاه داده ثبت شده باشد، این موضوع میتواند بر تحلیل آماری و آموزش مدلهای یادگیری ماشین تأثیر بگذارد.
معیارهای قابلیت استفاده از داده
پنج معیار بعدی به این سؤال پاسخ میدهند که آیا داده، زمانی که به آن نیاز داریم، قابل استفاده و قابل ردیابی است یا خیر؟
۹. در دسترس بودن (Availability)
داده باید زمانی که سیستم یا کاربر به آن نیاز دارد در دسترس باشد.
ممکن است یک مجموعه داده از نظر دقت و کامل بودن عالی باشد، اما اگر دسترسی به آن دشوار، محدود یا غیرقابل اتکا باشد، استفاده عملی از آن با مشکل مواجه خواهد شد.
۱۰. پوشش (Coverage)
Coverage مشخص میکند که داده تا چه اندازه دامنه موردنظر را پوشش میدهد.
برای مثال، یک مجموعه داده آموزشی که فقط اطلاعات یک منطقه جغرافیایی، گروه سنی یا نوع خاصی از کاربران را در اختیار داشته باشد، ممکن است برای یک کاربرد گسترده پوشش کافی نداشته باشد.
پوشش ناکافی میتواند یکی از عوامل ایجاد سوگیری در مدلهای هوش مصنوعی باشد.
۱۱. تبار داده (Lineage)
تبار داده به سابقه و منشأ داده مربوط میشود؛ یعنی بتوان مشخص کرد داده از کجا آمده، چه تغییراتی روی آن انجام شده و چه مسیری را طی کرده است.
شناخت Data Lineage برای سازمانهایی که میخواهند کیفیت داده را کنترل و نتایج مدلهای AI را بررسی کنند، اهمیت زیادی دارد.
۱۲. قابلیت ردیابی (Traceability)
قابلیت ردیابی به امکان دنبال کردن داده و ارتباط آن با منبع، فرایند یا نسخه اصلی مربوط میشود.
این ویژگی کمک میکند در صورت مشاهده یک خطا، بتوان مسیر داده را دنبال کرد و مشخص کرد مشکل از کجا به وجود آمده است.
۱۳. بهموقع بودن (Timeliness)
بهموقع بودن نشان میدهد که آیا داده در زمان مناسب و با میزان تازگی موردنیاز در اختیار سیستم قرار دارد یا خیر.
برای مثال، دادهای که وضعیت لحظهای بازار را نشان میدهد، اگر چند روز دیرتر در اختیار مدل قرار گیرد، ممکن است عملاً ارزش خود را از دست بدهد.
معیارهای عدالت و سوگیری در داده
ETSI سه معیار را برای بررسی جنبههای مختلف Fairness در دادهها در نظر گرفته است. این بخش برای هوش مصنوعی اهمیت ویژهای دارد؛ زیرا سوگیری موجود در داده میتواند به خروجیهای ناعادلانه مدل منجر شود.
۱۴. کیفیت برچسبها (Label Quality)
بسیاری از مدلهای یادگیری ماشین به دادههای برچسبگذاریشده نیاز دارند. بنابراین کیفیت این برچسبها مستقیماً بر کیفیت مدل تأثیر میگذارد.
اگر دادهها بهصورت اشتباه یا ناسازگار برچسبگذاری شده باشند، مدل نیز ممکن است الگوهای اشتباه را یاد بگیرد.
۱۵. سوگیری اندازهگیری (Measurement Bias)
سوگیری اندازهگیری زمانی ایجاد میشود که روش اندازهگیری یا جمعآوری داده به شکل سیستماتیک باعث ایجاد تفاوت یا انحراف در نتایج شود.
در چنین شرایطی، داده ممکن است ظاهراً دقیق به نظر برسد، اما روش جمعآوری آن باعث شده باشد برخی گروهها یا شرایط به شکل متفاوتی ثبت شوند.
۱۶. سوگیری بازنمایی (Representation Bias)
سوگیری بازنمایی زمانی رخ میدهد که برخی گروهها در مجموعه داده بیش از حد یا کمتر از حد واقعی خود حضور داشته باشند.
برای نمونه، اگر یک مدل تشخیص چهره عمدتاً با تصاویر مربوط به یک گروه جمعیتی آموزش داده شود، ممکن است عملکرد آن برای گروههای دیگر ضعیفتر باشد.
به همین دلیل، صرفاً زیاد بودن حجم داده کافی نیست؛ داده باید نماینده جامعه یا مسئلهای باشد که مدل قرار است روی آن کار کند.
حریم خصوصی و استفاده مسئولانه از داده
دو معیار پایانی به حریم خصوصی و حفاظت از اطلاعات اختصاص دارند.
۱۷. ناشناسبودن (Anonymity)
ناشناسبودن بررسی میکند که آیا میتوان از طریق اطلاعات موجود در یک مجموعه داده، افراد مشخص را شناسایی کرد یا خیر.
این مسئله اهمیت زیادی دارد، زیرا حتی اگر نام افراد از یک دیتاست حذف شده باشد، ترکیب چند ویژگی دیگر ممکن است همچنان امکان شناسایی آنها را فراهم کند.
۱۸. محرمانگی (Confidentiality)
محرمانگی بررسی میکند که اطلاعات حساس و شخصی چگونه محافظت میشوند و آیا افراد غیرمجاز میتوانند به آنها دسترسی پیدا کنند یا خیر.
استفاده از روشهایی مانند کنترل دسترسی، ماسککردن و رمزنگاری میتواند در حفاظت از دادههای حساس نقش داشته باشد.
ETSI این ۱۸ معیار را چگونه آزمایش کرد؟
پژوهشگران برای بررسی کاربرد عملی این چارچوب، معیارهای ETSI را روی دو مجموعه داده متفاوت آزمایش کردند: دادههای حسگرهای Industrial IoT و دادههای جمعیتی (Demographic Data).
نتایج نشان داد که اهمیت هر معیار به نوع داده و هدف استفاده از آن بستگی دارد.
برای دادههای حسگرهای صنعتی، معیارهایی مانند قابلیت اطمینان، بهموقع بودن، دقت، کامل بودن، قابلیت ردیابی و یکپارچگی اهمیت ویژهای داشتند.
در مقابل، برای دادههای جمعیتی، مواردی مانند کامل بودن، ناشناسبودن، سوگیری بازنمایی، کیفیت برچسبها، محرمانگی و پوشش اهمیت بیشتری پیدا کردند.
این موضوع یک نکته مهم را نشان میدهد: قرار نیست همه مجموعههای داده دقیقاً با وزن یکسانی بر اساس ۱۸ معیار ارزیابی شوند. اهمیت هر معیار به کاربرد و هدف مجموعه داده بستگی دارد.
یک نمونه واقعی از سوگیری در داده
در آزمایش انجامشده روی دادههای جمعیتی، پژوهشگران تفاوتهایی میان گروههای مختلف مشاهده کردند که میتواند نشانه وجود سوگیری باشد.
برای مثال، در دادههای مورد بررسی، حدود ۳۱ درصد از مردان بهعنوان افراد با درآمد بالا طبقهبندی شده بودند، در حالی که این رقم برای زنان حدود ۱۱ درصد بود.
این اختلاف قابل توجه، نمونهای از مسئلهای است که معیارهای مربوط به عدالت و سوگیری میتوانند در یک مجموعه داده آشکار کنند.
بنابراین حتی اگر داده از نظر فنی کامل و دقیق باشد، همچنان ممکن است از نظر نمایندگی گروههای مختلف و عدالت مشکل داشته باشد.
حریم خصوصی؛ حتی بدون نام هم ممکن است افراد شناسایی شوند
یکی دیگر از یافتههای مهم آزمایش، مربوط به حریم خصوصی دادههای جمعیتی بود.
پژوهشگران نشان دادند که ترکیب چند ویژگی مانند سن، نژاد، جنسیت و کشور میتواند در برخی موارد برای شناسایی افراد کافی باشد.
این مسئله اهمیت معیار Anonymity را نشان میدهد. حذف نام یا شناسه مستقیم افراد لزوماً به معنای ناشناس بودن کامل یک مجموعه داده نیست.
همچنین بررسیها نشان داد که برخی اطلاعات شخصی به شکل متن ساده ذخیره شده بودند و از روشهایی مانند ماسککردن یا رمزنگاری برای حفاظت از آنها استفاده نشده بود؛ موضوعی که معیار Confidentiality را تحت تأثیر قرار میدهد.
یک ابزار متنباز برای ارزیابی کیفیت داده
تیم تهیهکننده این گزارش علاوه بر تعریف ۱۸ معیار، یک سیستم متنباز اعتبارسنجی کیفیت داده نیز توسعه داده است.
این ابزار میتواند یک مجموعه داده را بر اساس ۱۸ معیار تعریفشده در TR 104 180 امتیازدهی کند. تیم توسعه این سامانه شامل پژوهشگرانی از Sejong University، EGM، TTA، Daejeon University و CNIT بوده است.
هدف از چنین ابزاری این است که صاحبان داده بتوانند کیفیت مجموعه دادههای خود را ارزیابی و نتایج را به شکل شفافتری گزارش کنند.
چرا این استاندارد برای هوش مصنوعی مهم است؟
مدلهای هوش مصنوعی ممکن است بسیار قدرتمند باشند، اما اگر دادههای مورد استفاده آنها ناقص، نادرست، قدیمی، سوگیرانه یا فاقد حفاظت مناسب باشند، خروجی مدل نیز میتواند قابل اعتماد نباشد.
رویکرد ETSI یک نکته مهم را برجسته میکند: کیفیت داده فقط به Accuracy محدود نمیشود.
یک مجموعه داده قابل اعتماد باید تا حد امکان:
- کامل باشد؛
- دقیق و سازگار باشد؛
- قابلیت اطمینان و یکپارچگی داشته باشد؛
- دادههای تکراری غیرضروری نداشته باشد؛
- در زمان مناسب در دسترس باشد؛
- منبع و مسیر تغییرات آن مشخص باشد؛
- دامنه مناسبی را پوشش دهد؛
- بهاندازه کافی بهروز باشد؛
- از نظر برچسبگذاری و بازنمایی دچار سوگیری نباشد؛
- و از نظر ناشناسسازی و محرمانگی نیز استانداردهای لازم را رعایت کند.
به همین دلیل، ETSI TR 104 180 میتواند چارچوبی کاربردی برای سازمانهایی باشد که میخواهند پیش از استفاده از داده در پروژههای هوش مصنوعی، کیفیت آن را به شکل کمی و قابل تکرار ارزیابی کنند. ETSI نیز تأکید کرده است که این معیارها با هدف ایجاد رویکردی استاندارد، سازگار و قابل تکرار برای سنجش کیفیت داده طراحی شدهاند.
جمعبندی
گزارش ETSI TR 104 180 تلاش میکند ارزیابی کیفیت داده را از یک بررسی کلی و تا حدی سلیقهای، به یک فرایند استاندارد و قابل اندازهگیری تبدیل کند.
۱۸ معیار این گزارش چهار جنبه اصلی را پوشش میدهند: کیفیت بنیادی داده، قابلیت استفاده، عدالت و حریم خصوصی.
اهمیت این چارچوب با گسترش هوش مصنوعی بیشتر میشود؛ زیرا سازمانها برای ساخت سیستمهای Trustworthy AI تنها به مدلهای قدرتمند نیاز ندارند، بلکه باید بتوانند نشان دهند دادهای که در اختیار مدل قرار گرفته نیز کیفیت، قابلیت اعتماد و سطح حفاظت مناسبی دارد.