ارزیابی در عمل چگونه کار میکند
بیشتر ابزارهای سنجش بلوغ هوش مصنوعی نمیگویند چگونه به یک عدد میرسند. این صفحه روش را منتشر میکند: پنج مرحلهٔ چرخهٔ عمر منطبق بر ISO/IEC 42001، هشت بُعد امتیازدهیشده در قالب دو امتیاز مجزا، شاخصهای بلوغ، و سطوح شواهدی که تعیین میکنند هر پاسخ واقعاً چه ارزشی دارد. بانک پرسشها محرمانه میماند. روش نه.
این یک ارزیابی آمادگی است، نه ممیزی انطباق یا مشاورهٔ حقوقی. گواهینامهٔ ISO/IEC 42001 فقط توسط نهاد صدور گواهینامهای اعطا میشود که طبق ISO/IEC 42006 اعتبارنامه دارد. خروجی این روش یک امتیاز آمادگی، نیمرخ بلوغ و یافتههای اولویتبندیشده است — و هرگز بیانیهای مبنی بر اینکه سازمانی با استاندارد یا مقرراتی منطبق است یا نیست.
ارزیابی آمادگی هوش مصنوعی چیست؟
ارزیابی آمادگی هوش مصنوعی، بازبینی ساختاریافتهای از نحوهٔ بهکارگیری، حاکمیت و نظارت سازمان بر هوش مصنوعی است. خروجی آن دو امتیاز، نیمرخ بلوغ در هشت بُعد و یافتههای اولویتبندیشده است — که در برابر ISO/IEC 42001، ISO/IEC 23894، چارچوب مدیریت ریسک هوش مصنوعی NIST و قانون هوش مصنوعی اتحادیه اروپا سنجیده میشود.
واژهٔ آمادگی در اینجا بار معنایی واقعی دارد. مترادف انطباق نیست و ممیزی فناوری هم نیست. پرسشی محدودتر و مفیدتر مطرح میکند: اگر فردا یک مشتری، بیمهگر، ممیز یا ناظر از راه برسد و بپرسد از هوش مصنوعی چگونه استفاده میکنید و چه کسی مسئول آن است، واقعاً چه چیزی میتوانید نشانش دهید؟
دو سازمان ممکن است از ابزارهای هوش مصنوعی یکسانی استفاده کنند و در وضعیت کاملاً متفاوتی باشند. تفاوت بهندرت در فناوری است. تفاوت در این است که آیا کسی مالک آن است، آیا کسی میتواند آن را متوقف کند، و آیا چیزی مکتوب شده است.
پنج مرحله، منطبق بر ISO/IEC 42001
حاکمیت یک چرخهٔ عمر است، نه یک سند. این پنج مرحله توالیای است که طی میکنم و هر کدام با بندهای مشخصی از ISO/IEC 42001 متناظر است — بنابراین کاری که در هر مرحله انجام میدهید، کاری است که نهاد صدور گواهینامه بعداً آن را به رسمیت میشناسد، نه کاری که باید دوباره انجام شود.
ارزیابی — تعیین وضعیت
- تعیین دامنهٔ سیستمهای هوش مصنوعی در حال استفاده، از جمله ابزارهای رایگان و ابزارهایی که غیررسمی به کار گرفته شدهاند.
- امتیازدهی هشت بُعد؛ تولید امتیاز آمادگی و امتیاز حاکمیت.
- شناسایی ذینفعان، تعهدات و ناظرانی که منفعت مشروع دارند.
- خروجی: نیمرخ امتیازدهیشده، یافتههای اولویتبندیشده، یک گام بعدی پیشنهادی.
تعریف — تصمیم دربارهٔ اینکه چه ریسکی را میپذیرید
- تعیین یک مالک پاسخگوی واحد، با اختیار مکتوب برای متوقف کردن استفاده از یک ابزار.
- تعیین خطمشی هوش مصنوعی، میزان ریسکپذیری و اهدافی که خطمشی برای تحقق آنها وجود دارد.
- تعریف دروازهٔ تأییدی که هر ابزار جدید هوش مصنوعی باید پیش از استفاده از آن عبور کند.
- خروجی: خطمشی هوش مصنوعی، بیانیهٔ ریسکپذیری، مالک پاسخگو، دروازهٔ تأیید.
ساخت — استقرار کنترلها
- فهرست سیستمهای هوش مصنوعی، سوابق منشأ دادهها و بازبینی شرایط تأمینکنندگان.
- ثبت ریسکهای هوش مصنوعی؛ ارزیابی اثر در جایی که تصمیمهای مبتنی بر هوش مصنوعی بر افراد اثر میگذارند.
- بیانیهٔ کاربستپذیری، نقاط نظارت انسانی و آموزش کارکنان همراه با سابقهٔ آن.
- خروجی: سیستم مدیریت هوش مصنوعی که در عمل وجود دارد، نه فقط روی کاغذ.
بازبینی — آزمون مستقل
- ممیزی داخلی در برابر استاندارد، به همان شیوهای که یک ممیز ارشد انجام میدهد — یا توسط تیم خودتان که برای انجامش آموزش دیده است.
- آزمون شواهد: نه «آیا خطمشی وجود دارد»، بلکه «آیا میتوانید سابقه را ارائه دهید».
- بستهٔ بازنگری مدیریت، تا هوش مصنوعی به یک دستور کار ثابت تبدیل شود، نه واکنشی به حادثه.
- خروجی: گزارش یافتههای مستقل، عدمانطباقها درجهبندیشده بر اساس شدت.
بهبود — و در صورت تمایل، آمادگی برای گواهینامه
- اقدامات اصلاحی بسته و مستند شدهاند؛ بازگشت به مرحلهٔ ۱ در یک چرخهٔ مشخص.
- ارزیابی شکاف در برابر ISO/IEC 42001 پیش از همکاری با نهاد صدور گواهینامهٔ دارای اعتبارنامه.
- پشتیبانی در طول ارزیابی خودِ نهاد صدور گواهینامه — در کنار شما.
- خروجی: سیستمی که از ممیزی بیرونی سربلند بیرون میآید. من گواهینامه صادر نمیکنم و مجاز به این کار نیستم.
هشت بُعد چه چیزی را میسنجند؟
هشت بُعد، که جداگانه امتیاز میگیرند و سپس بهجای یک امتیاز، در قالب دو امتیاز ترکیب میشوند. یک عدد ترکیبی واحد، مهمترین نیمرخ را پنهان میکند — سازمانی که هوش مصنوعی را سریع به کار میگیرد، در حالی که حاکمیتش درجا میزند.
امتیاز آمادگی
آیا این سازمان میتواند از هوش مصنوعی ارزش بگیرد و آیا میداند چه چیزی را اجرا میکند؟
امتیاز حاکمیت
اگر کسی از شما بخواهد دربارهٔ نحوهٔ استفاده از هوش مصنوعی در اینجا پاسخگو باشید، میتوانید؟
اگر خروجی هوش مصنوعی بدون امکان بازبینی یا لغو توسط یک انسان به مشتری یا یک تصمیم برسد، این یافته بر کل مدل امتیازدهی اولویت دارد. صرفنظر از اینکه سازمان در سایر بخشها چه امتیازی گرفته باشد، پیگیری میشود.
امتیاز چگونه به یک سطح تبدیل میشود؟
هر بُعد امتیاز میگیرد، وزندهی میشود و بهصورت درصدی از حداکثر امتیاز ممکن بیان میشود. سپس دو امتیاز در یکی از چهار سطح قرار میگیرند. سطوح مطلقاند، نه مقایسهای — وضعیت شما را در برابر استانداردها توصیف میکنند، نه در برابر سازمانهای دیگر.
مقدماتی
هوش مصنوعی در حال استفاده است و عملاً مدیریت نمیشود. هیچ چیز مکتوب نیست و هیچکس مالک آن نیست. گام نخست کوچک و روشن است.
در حال توسعه
آگاهی وجود دارد و برخی رویهها بهصورت غیررسمی شکل گرفتهاند، اما تقریباً هیچچیز در برابر درخواست شواهد دوام نمیآورد.
تثبیتشده
مالکیت، خطمشی و سوابق وجود دارند و بهطور کلی رعایت میشوند. شکافها موردیاند، نه سیستمی.
پیشرفته
سیستم مدیریت فعال است، در چرخهای مشخص بازبینی میشود و در صورت درخواست شواهد ارائه میدهد. گواهینامه هدفی واقعبینانه است.
مقیاس بلوغ ۰ تا ۴، با یک مثال عملی
هر پرسش عبارتهای شاخص دارد، بنابراین امتیازدهی یعنی تطبیق با یک توصیف، نه شکلدادن به یک برداشت. در اینجا مجموعهٔ کامل شاخصها برای یک بُعد — D3، خطمشی و نظارت — دقیقاً همانطور که در ابزار سنجش نوشته شده آمده است.
| سطح | عبارت شاخص — «آیا خطمشی مکتوبی دربارهٔ نحوهٔ استفاده از هوش مصنوعی در اینجا وجود دارد؟» | معنای آن |
|---|---|---|
| 0 | خیر. | غایب. چیزی برای ارائه وجود ندارد. |
| 1 | انتظارات نانوشتهای داریم. | ضمنی. رویه در ذهن افراد است و با رفتنشان از بین میرود. |
| 2 | چیزی مکتوب وجود دارد، اما واقعاً استفاده نمیشود. | مستند اما بیاثر. با نخستین پرسش دربارهٔ اجرا ناکام میماند. |
| 3 | بله — مکتوب، بهروز، و افراد آن را رعایت میکنند. | فعال. سقف هر پاسخ خوداظهاری. |
| 4 | فعال، و در بررسی اثباتشده. | مستند با شواهد. فقط زمانی حاصل میشود که مستند ارائه و آزموده شده باشد. |
موارد وزندار — مالکیت رهبری، خطمشی، دروازهٔ تأیید، پرسش ناظر، قابلیت ممیزی، دقت، بازبینی انسانی و مدیریت دادههای شخصی — دو برابر حساب میشوند، زیرا ناکامی در هر یک از آنها معنای همهٔ پاسخهای دیگر را تغییر میدهد.
چرا خودارزیابی پایینتر از بالاترین سطح محدود میشود؟
چون هیچ چیزی بررسی نشده است. هر پاسخی که بدون بررسی داده شود، اظهار است، نه مستند — بنابراین به سطح ۳ از ۴ محدود میشود. این سقف عمدی است و توصیفی صادقانه از ارزشی است که یک همکاری پولی میافزاید.
| سطح | معنای آن | نحوهٔ دستیابی |
|---|---|---|
| E0 | اظهارشده. کسی باور دارد که این درست است. | هر پاسخی که بدون بازبینی داده شود. |
| E1 | توصیفشده. رویه را میتوان بهطور منسجم و یکنواخت توضیح داد. | ارزیابی بازبینیشده — پاسخها را یک فرد میخواند و به پرسش میگیرد. سقف خودارزیابی. |
| E2 | مستندشده. مستند وجود دارد و دیده شده است. | اسکن یا ممیزی — بررسی خطمشیها، ثبتها، سوابق و شرایط تأمینکنندگان. |
| E3 | فعال. کنترل آزموده شده و مشخص شده که در عمل کار میکند. | ممیزی کامل — نمونهگیری، بازدید گامبهگام و آزمون در برابر سوابق واقعی. |
ارزیابی رایگان بر اساس آنچه شما میگویید امتیاز میگیرد. همکاری پولی، شواهد پشت پاسخهای شما را بررسی میکند — به همین دلیل بالاترین امتیاز در خودارزیابی در دسترس نیست. این همان تفاوتی است که برایش هزینه میپردازید، بهصراحت.
این روش بر چه استانداردهایی بنا شده است؟
این روش بر استانداردهای زیر استوار است و ساختار آن بر پایهٔ ISO/IEC 42001 است. بر روششناسی ممیز ارشد و مجری ارشد ISO/IEC 27001 که در اختیار دارم و به کار میگیرم بنا شده — و به استانداردهای ویژهٔ هوش مصنوعی گسترش یافته است؛ استانداردهایی جدیدتر که جایگاه من در آنها دانش کاربردی و تجربهٔ عملی است، نه دارا بودن گواهینامه.
| استاندارد یا مقررات | کاربرد آن | جایگاه آن در این روش |
|---|---|---|
| ISO/IEC 42001 | سیستمهای مدیریت هوش مصنوعی — استاندارد قابلگواهی برای نحوهٔ حاکمیت سازمان بر هوش مصنوعی. | ستون فقرات. هر پنج مرحله با بندهای آن منطبقاند؛ بیانیهٔ کاربستپذیری و کنترلهای پیوست A در مرحلهٔ ۳ قرار دارند. |
| ISO/IEC 23894 | راهنمای مدیریت ریسک هوش مصنوعی، همسو با ISO 31000. | ریسکپذیری در مرحلهٔ ۲ و ثبت ریسکهای هوش مصنوعی در مرحلهٔ ۳. |
| ISO/IEC 42005 | راهنمای ارزیابی اثر سیستمهای هوش مصنوعی. | مرحلهٔ ۳، هر جا تصمیمهای مبتنی بر هوش مصنوعی مستقیماً بر افراد اثر بگذارند — استخدام، قیمتگذاری، اعتبار، درمان. |
| ISO/IEC 27001 | مدیریت امنیت اطلاعات — مدرکی که این روش بر آن بنا شده است. | زیرساخت داده، شرایط تأمینکنندگان، دسترسیها و کل انضباط ممیزی در مرحلهٔ ۴. |
| NIST AI RMF | یک چارچوب داوطلبانهٔ آمریکایی: راهبری، نقشهبرداری، سنجش، مدیریت. | بررسی متقابل مجموعهٔ ابعاد، بهویژه سنجش و پایش. |
| EU AI Act | مقررات اتحادیه اروپا، با طبقهبندی ریسک بر اساس کاربرد و دامنهٔ اعمال فراسرزمینی. | تعیین شمول و طبقهٔ ریسک برای هر کاربرد، از مرحلهٔ ۱ به بعد. |
| UK GDPR | حفاظت از دادهها در جایی که هوش مصنوعی دادههای شخصی را پردازش میکند. | D6. اینکه آیا این استفاده ارزیابی شده و توسط چه کسی. |
| ناظران بریتانیا | نظارت بخشی — ICO، MHRA، FCA، CQC، GDC و دیگران. | D3. بریتانیا قانون واحدی برای هوش مصنوعی ندارد؛ انتظارات ناظر شما تعهد جاری است. |
الزامات GPAI در قانون هوش مصنوعی اتحادیه اروپا از ۲ اوت ۲۰۲۶ لازمالاجرا شد. الزامات سیستمهای پرخطر طبق بستهٔ Digital Omnibus به ۲ دسامبر ۲۰۲۷ موکول شد. در بریتانیا، لایحهٔ هوش مصنوعی (مقررات) [HL] همچنان یک لایحهٔ پیشنهادی نماینده است و نه سیاست دولت، و رویکرد بریتانیا بر عهدهٔ نهادهای ناظر است. نبودن قانون هوش مصنوعی در بریتانیا به معنای نبودن تعهدات نیست — ناظران بخشی هماکنون فعالاند و قانون حفاظت از دادهها هماکنون اعمال میشود.
وضعیت مقررات بررسیشده در: ۳ سپتامبر ۲۰۲۶پرسشها دربارهٔ روش
تفاوت آمادگی هوش مصنوعی با انطباق هوش مصنوعی چیست؟
آمادگی، سنجش وضعیت خود شماست: چه چیزی وجود دارد، چه چیزی مستند شده، چه چیزی واقعاً اجرا میشود و شکافها کجاست. انطباق، حکمی است که در برابر یک الزام حقوقی یا گواهینامهای مشخص صادر میشود — و برای ISO/IEC 42001 فقط نهاد صدور گواهینامهٔ دارای اعتبارنامهٔ ISO/IEC 42006 میتواند آن را اعطا کند. ارزیابی آمادگی به شما میگوید یک نهاد صدور گواهینامه یا یک ناظر احتمالاً چه چیزی خواهد یافت. هرگز جایگزین داوری آنها نمیشود.
آیا قانون هوش مصنوعی اتحادیه اروپا شامل کسبوکارهای بریتانیایی میشود؟
ممکن است. این قانون فراسرزمینی اعمال میشود، یعنی هر جا خروجی یک سیستم هوش مصنوعی در اتحادیه اروپا استفاده شود؛ بنابراین سازمانی بریتانیایی که به مشتریان اروپایی خدمت میدهد یا محصولی مبتنی بر هوش مصنوعی را در بازار اتحادیه اروپا عرضه میکند، ممکن است حتی بدون داشتن دفتر در اتحادیه اروپا مشمول آن باشد. الزامات GPAI از ۲ اوت ۲۰۲۶ لازمالاجرا شد؛ الزامات سیستمهای پرخطر طبق بستهٔ Digital Omnibus به ۲ دسامبر ۲۰۲۷ موکول شد. شمول باید برای هر کاربرد جداگانه بررسی شود، نه اینکه از پیش در هر جهتی فرض شود. وضعیت مقررات بررسیشده در ۳ سپتامبر ۲۰۲۶.
آیا به سازمانها گواهینامهٔ ISO/IEC 42001 میدهید؟
خیر، و هیچ مشاوری نمیتواند. گواهینامهٔ ISO/IEC 42001 فقط توسط نهاد صدور گواهینامهای اعطا میشود که طبق ISO/IEC 42006 اعتبارنامه دارد — و نهادی که دربارهٔ سیستم مدیریت شما مشاوره داده باشد، بعداً نمیتواند برای آن گواهینامه صادر کند. کار من آماده کردن سازمانها برای آن ارزیابی و بازبینی مستقل سیستم آنهاست، با روششناسی ممیز ارشد و مجری ارشد که در ISO/IEC 27001 دارم. بیان این مرز خودِ اصل مطلب است، نه یک تبصره.
اگر فقط از ChatGPT استفاده میکنیم، باز هم به این نیاز داریم؟
اغلب بله، و به دلیلی که هیچ ربطی به پیشرفته بودن ابزار ندارد. پرسشهایی که کمترین امتیاز را میآورند تقریباً هیچوقت دربارهٔ مدل نیستند — بلکه دربارهٔ ایناند که آیا کسی مالک تصمیم استفاده از آن است، آیا کارکنان میدانند مجازند چه چیزی را در آن وارد کنند، و آیا اگر مشکلی رخ دهد کسی متوجه میشود. یک ابزار عمومی پرکاربرد بدون هیچ خطمشی پشتیبان، یافتهای رایجتر از یک مجموعهٔ پیچیدهٔ هوش مصنوعی است.
چرا دو امتیاز بهجای یک عدد کلی؟
چون نیمرخ خطرناک در یک عدد واحد دیده نمیشود. سازمانی با امتیاز آمادگی قوی و امتیاز حاکمیت ضعیف، سریع حرکت میکند و در معرض خطر است — واقعاً توانمند، در حال بهکارگیری سریع، با نظارتی که همپا نشده است. در یک عدد ترکیبی متوسط به نظر میرسد. در دو عدد جداگانه، روشنترین یافتهٔ صفحه است.
آیا میتوانم بانک پرسشها را ببینم؟
روش در اینجا منتشر شده است؛ بانک پرسشها نه. ابزار ۱۴۸ پرسشی مشاور و پرسشنامهٔ غربالگری ۴۲ پرسشی، مالکیت فکری پشت این خدمتاند، و انتشار آنها به سازمانها اجازه میدهد پاسخهایشان را از پیش تمرین کنند — که امتیاز حاصل را بیارزش میکند. گزیدهای از بخشهای روششناسی، بدون بانک پرسشها، در صورت درخواست در دسترس است.
چه کسی پاسخها را میبیند و دادهها چگونه مدیریت میشوند؟
پاسخها طبق رویههای همسو با ISO/IEC 27001 مدیریت میشوند: رمزگذاریشده در حین انتقال و ذخیرهسازی، میزبانیشده در بریتانیا یا منطقهٔ اقتصادی اروپا، و فقط در دسترس افراد مشخص. سوابق ارزیابی ۲۴ ماه نگهداری و سپس حذف یا بهطور برگشتناپذیر ناشناس میشوند. هر پژوهش منتشرشده فقط از دادههای تجمیعی ناشناس استفاده میکند، و هرگز در جایی که جمعیت آنقدر کوچک باشد که نتوان از شناسایی پاسخدهنده جلوگیری کرد.
این روش کجا به کار گرفته میشود
ارزیابی و ممیزیهای با دامنهٔ ثابت از طریق VisionXY7، شرکتی که بنیان گذاشتهام، ارائه میشوند. استقرار حاکمیت، بازبینی مستقل و خدمات مدیر ارشد هوش مصنوعی که در ادامه آمدهاند، همکاریهایی هستند که شخصاً هدایت میکنم.
ارائهشده توسط دکتر مهدی سیفی — دکترا (تحلیلگری کسبوکار مبتنی بر هوش مصنوعی)، دانشگاه لیورپول · MBA، سیستمهای اطلاعاتی · ممیز ارشد و مجری ارشد ISO/IEC 27001.