بازگشت به وبلاگ

APCER، BPCER، FAR و FRR؛ زبان مشترک ارزیابی سامانه‌های بیومتریک

چهار نرخ خطای مهم، چه چیزی را اندازه می‌گیرند و چرا نباید معیارهای Liveness را با معیارهای تشخیص چهره یکسان دانست؟

APCER، BPCER، FAR و FRR؛ زبان مشترک ارزیابی سامانه‌های بیومتریک

دو مسئله متفاوت، دو خانواده معیار

در یک فرایند احراز هویت چهره معمولاً دو تصمیم مستقل وجود دارد: نخست اینکه ورودی متعلق به یک انسان واقعی است یا حمله بازنمایی؛ دوم اینکه چهره ورودی با هویت مرجع تطبیق دارد یا خیر. APCER و BPCER برای ارزیابی تشخیص حمله یا Liveness به کار می‌روند، در حالی که FAR و FRR رفتار سامانه تطبیق هویت را اندازه می‌گیرند.

نمایش مفهومی معیارهای خطای Liveness و تشخیص چهره

APCER چیست؟

APCER مخفف Attack Presentation Classification Error Rate است. این معیار نشان می‌دهد چه نسبتی از حملات بازنمایی به اشتباه به‌عنوان نمونه واقعی پذیرفته شده‌اند.

APCER = تعداد حملات پذیرفته‌شده به‌عنوان واقعی ÷ کل حملات آزمون‌شده

اگر از هر ۱۰٬۰۰۰ تلاش حمله، ۲۰ مورد به اشتباه Live تشخیص داده شود، APCER برابر ۰٫۲ درصد است. کاهش APCER برای جلوگیری از عبور عکس چاپی، نمایشگر یا بازپخش ویدئو اهمیت دارد.

در ارزیابی دقیق، APCER باید برای هر نوع ابزار حمله یا PAI جداگانه گزارش شود. میانگین کلی ممکن است ضعف مدل در برابر یک حمله خاص را پنهان کند.

BPCER چیست؟

BPCER مخفف Bona Fide Presentation Classification Error Rate است. این معیار نسبت کاربران واقعی را نشان می‌دهد که سامانه به اشتباه حمله تشخیص داده و رد کرده است.

BPCER = تعداد نمونه‌های واقعی ردشده ÷ کل نمونه‌های واقعی آزمون‌شده

BPCER بالا مستقیماً تجربه کاربری را آسیب می‌زند. کاربر واقعی مجبور به تکرار تصویربرداری یا مراجعه حضوری می‌شود و نرخ تکمیل فرایند کاهش پیدا می‌کند.

رابطه APCER و BPCER

تغییر Threshold معمولاً این دو خطا را در جهت مخالف حرکت می‌دهد. سخت‌گیری بیشتر می‌تواند APCER را کاهش دهد، اما احتمال رد کاربران واقعی و BPCER را افزایش می‌دهد. بنابراین اعلام یکی از این دو نرخ بدون ذکر دیگری و بدون مشخص‌کردن نقطه عملکرد، تصویر کاملی از مدل ارائه نمی‌کند.

ACER گاهی به‌صورت میانگین APCER و BPCER گزارش می‌شود، اما استفاده از یک میانگین ساده ممکن است هزینه متفاوت دو نوع خطا را پنهان کند. در محیط حساس بهتر است هر معیار مستقل و به تفکیک سناریو ارائه شود.

FAR چیست؟

FAR یا False Accept Rate نسبت تلاش‌های افراد متفاوت است که سامانه تشخیص چهره به اشتباه آن‌ها را متعلق به یک هویت دانسته و پذیرفته است.

FAR(t) = پذیرش اشتباه در Threshold برابر t ÷ کل تلاش‌های Impostor

برای اندازه‌گیری FAR پایین به تعداد بسیار زیادی زوج Impostor نیاز است. برای نمونه، ادعای نرخ‌های بسیار کوچک با چند هزار مقایسه از نظر آماری قابل اتکا نیست؛ چون ممکن است در مجموعه آزمایش حتی یک خطا مشاهده نشود، اما این به معنی صفر بودن ریسک واقعی نیست.

FRR چیست؟

FRR یا False Reject Rate نسبت تلاش‌های واقعی یک فرد است که سامانه به اشتباه آن‌ها را رد می‌کند.

FRR(t) = رد اشتباه در Threshold برابر t ÷ کل تلاش‌های Genuine

FRR به تغییر سن، نور، زاویه، کیفیت دوربین، پوشش صورت و فاصله زمانی میان ثبت مرجع و نمونه جدید حساس است. برای همین مجموعه Genuine باید تنوع واقعی استفاده را بازنمایی کند.

Threshold چگونه انتخاب می‌شود؟

مدل تشخیص چهره برای هر زوج تصویر SimilarityScore تولید می‌کند. با حرکت Threshold، تعداد پذیرش‌ها و ردها تغییر می‌کند:

  • Threshold پایین‌تر، پذیرش را آسان‌تر می‌کند؛ FAR بیشتر و FRR کمتر می‌شود.
  • Threshold بالاتر، پذیرش را سخت‌تر می‌کند؛ FAR کمتر و FRR بیشتر می‌شود.

انتخاب نقطه عملکرد باید از سیاست ریسک سازمان آغاز شود. احراز هویت برای مشاهده یک خدمت عمومی و تأیید انتقال مالی پرمبلغ الزام امنیتی یکسانی ندارند. پس از تعیین FAR هدف، Threshold روی داده ارزیابی مستقل انتخاب و FRR متناظر گزارش می‌شود.

EER و منحنی DET

EER نقطه‌ای است که FAR و FRR تقریباً برابرند. این عدد برای مقایسه فشرده مدل‌ها مفید است، اما الزاماً نقطه عملیاتی مناسب سازمان نیست. سازمان ممکن است به FAR بسیار پایین نیاز داشته باشد و افزایش FRR را تا حد مشخصی بپذیرد.

منحنی DET یا ROC رفتار مدل را در مجموعه‌ای از Thresholdها نمایش می‌دهد. مشاهده کل منحنی بهتر از یک عدد منفرد نشان می‌دهد مدل در ناحیه ریسک مورد نظر چگونه عمل می‌کند.

تحلیل منحنی‌ها و توزیع امتیازهای سامانه بیومتریک در محیط آزمایشگاهی

در نمودار توزیع امتیازها، نمونه‌های Genuine و Impostor معمولاً دو توزیع هم‌پوشان می‌سازند. Threshold مرز تصمیم است و ناحیه هم‌پوشانی منبع دو خطای FAR و FRR محسوب می‌شود. هرچه جدایی دو توزیع بیشتر باشد، امکان دستیابی هم‌زمان به امنیت و تجربه کاربری بهتر افزایش می‌یابد.

نمونه محاسبه

فرض کنید مجموعه آزمون تشخیص چهره شامل ۲۰۰٬۰۰۰ تلاش Genuine و ۴۰۰٬۰۰۰ تلاش Impostor باشد. در Threshold انتخاب‌شده، ۶٬۰۰۰ تلاش Genuine رد و ۸ تلاش Impostor پذیرفته شده‌اند:

  • FRR = ۶٬۰۰۰ ÷ ۲۰۰٬۰۰۰ = ۳٪
  • FAR = ۸ ÷ ۴۰۰٬۰۰۰ = ۰٫۰۰۲٪

برای Liveness نیز اگر ۵۰٬۰۰۰ نمونه واقعی و ۲۰٬۰۰۰ حمله داشته باشیم و ۱٬۰۰۰ نمونه واقعی رد و ۱۰۰ حمله پذیرفته شوند:

  • BPCER = ۱٬۰۰۰ ÷ ۵۰٬۰۰۰ = ۲٪
  • APCER = ۱۰۰ ÷ ۲۰٬۰۰۰ = ۰٫۵٪

این چهار عدد درباره دو جزء متفاوت سامانه صحبت می‌کنند و نباید با هم ادغام شوند.

قواعد گزارش‌دهی قابل اعتماد

گزارش فنی باید نسخه مدل و پیش‌پردازش، Threshold، اندازه و ترکیب داده، انواع حمله، دستگاه‌ها، بازه اطمینان و شرایط تصویربرداری را مشخص کند. همچنین نتایج باید برای گروه‌های مهم جمعیتی و کانال‌های عملیاتی جداگانه بررسی شوند.

در Production نیز تغییر دوربین، فشرده‌سازی، SDK موبایل یا مدل می‌تواند کالیبراسیون را تغییر دهد. هر تغییر مهم باید با آزمون Regression و بازبینی Threshold همراه باشد.

جمع‌بندی

APCER و BPCER کیفیت تشخیص زنده‌بودن را توضیح می‌دهند؛ FAR و FRR کیفیت تطبیق هویت را. هیچ‌کدام به‌تنهایی کافی نیستند. تصمیم درست زمانی گرفته می‌شود که خطاهای امنیتی و تجربه کاربری در نقطه عملکرد واقعی و روی داده نماینده جامعه هدف، هم‌زمان اندازه‌گیری شوند.

اثر جابه‌جایی Threshold بر FAR و FRR

این منحنی‌ها مفهومی‌اند. نقطه عملیاتی واقعی فقط با داده ارزیابی نماینده جامعه هدف تعیین می‌شود.

APCERaccepted attacks / all attacksBPCERrejected bona fide / all bona fideFARfalse accepts / impostor attemptsFRRfalse rejects / genuine attempts