পাঠ ১০ · ৫৭-এর মধ্যে · মডিউল ৩
Home / AI Courses / Human-Centered AI / ট্রাস্ট ক্যালিব্রেশন

ট্রাস্ট ক্যালিব্রেশন — ওভার-ট্রাস্ট ও আন্ডার-ট্রাস্ট এড়ানো

Trust calibration — avoiding over-trust & under-trust
১০ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • ওভার-ট্রাস্ট ও আন্ডার-ট্রাস্টের সংজ্ঞা এবং দুটো কেন সমানভাবে ক্ষতিকর
  • কনফিডেন্স-থ্রেশহোল্ড নীতি কীভাবে কাজ করে — এবং কেন এটি একটি সরল কিন্তু কার্যকর ক্যালিব্রেশন টুল
  • কভারেজ (কতটা স্বয়ংক্রিয় হচ্ছে) বনাম নির্ভুলতার ট্রেড-অফ কীভাবে গণনা করে দেখা যায়
  • একটি সত্যিকারের Python সিমুলেশন যা naive ও থ্রেশহোল্ড নীতির ভুলের হার সরাসরি তুলনা করে

১ · ওভার-ট্রাস্ট ও আন্ডার-ট্রাস্ট — দুটো ভিন্ন সমস্যা, একই মূল কারণ

ট্রাস্ট ক্যালিব্রেশনTrust calibrationব্যবহারকারীর ট্রাস্টের মাত্রাকে সিস্টেমের প্রকৃত, মুহূর্ত-ভিত্তিক রিলায়াবিলিটির সাথে সামঞ্জস্যপূর্ণ রাখার প্রক্রিয়া — না বেশি, না কম। ওভার-ট্রাস্ট মানে ব্যবহারকারী সিস্টেমকে তার প্রকৃত রিলায়াবিলিটির চেয়ে বেশি বিশ্বাস করছেন — এর ফলাফল ভুল সিদ্ধান্ত অজান্তে গ্রহণ করা। আন্ডার-ট্রাস্ট মানে উল্টো — ব্যবহারকারী একটি সত্যিকারের নির্ভরযোগ্য সিস্টেমকেও যথেষ্ট ব্যবহার করছেন না, ফলে তার সুবিধা থেকে বঞ্চিত হচ্ছেন। L01-এর ডেমোতে আমরা ওভার-ট্রাস্ট দেখেছিলাম; L09-এ আমরা দেখেছিলাম কীভাবে এই গ্যাপ তৈরি হয়। এই পাঠে আমরা একটি নির্দিষ্ট ডিজাইন কৌশল দেখব যা এই গ্যাপ সরাসরি কমাতে পারে।

২ · কনফিডেন্স-থ্রেশহোল্ড নীতি

সবচেয়ে সহজ ক্যালিব্রেশন কৌশলগুলোর একটি হলো — সিস্টেম প্রতিটি সিদ্ধান্তের সাথে একটি কনফিডেন্স স্কোর দিক, এবং একটি নির্দিষ্ট থ্রেশহোল্ডের উপরে হলেই সেটি স্বয়ংক্রিয়ভাবে গ্রহণ করা হোক — নিচে হলে একজন মানুষ রিভিউ করুন। এটি naive "সবসময় গ্রহণ করো" নীতির চেয়ে আলাদা, কারণ এটি প্রতিটি সিদ্ধান্তকে আলাদাভাবে বিচার করে, শুধু গড় পারফরম্যান্সের উপর নির্ভর করে না।

naive always-accept
সব সিদ্ধান্ত সরাসরি গ্রহণ করা হয়, কনফিডেন্স যাই হোক — এটি সবচেয়ে সহজ কিন্তু সবচেয়ে ঝুঁকিপূর্ণ পদ্ধতি।
থ্রেশহোল্ড নীতি
শুধু যথেষ্ট-কনফিডেন্ট সিদ্ধান্তগুলো স্বয়ংক্রিয়ভাবে গ্রহণ করা হয়; বাকিগুলো মানুষের কাছে যায় — কভারেজ কমে, কিন্তু গৃহীত সিদ্ধান্তের নির্ভুলতা বাড়ে।
থ্রেশহোল্ড একটি ডায়াল
থ্রেশহোল্ড বাড়ালে নির্ভুলতা বাড়ে কিন্তু কভারেজ কমে; কমালে উল্টো — সঠিক মান নির্ভর করে ভুলের খরচ কতটা বেশি তার উপর (M5-এ "levels of automation"-এ বিস্তারিত)।

৩ · একটি সত্যিকারের তুলনা — কোড দিয়ে

নিচের সিমুলেশনে ২০০টি AI সিদ্ধান্ত তৈরি করা হয়েছে, প্রতিটির একটি এলোমেলো কনফিডেন্স স্কোর (০.৫০ থেকে ১.০০-এর মধ্যে) আছে, এবং প্রতিটি সিদ্ধান্ত সঠিক হওয়ার সম্ভাবনা তার নিজের কনফিডেন্স স্কোরের সমান (অর্থাৎ সিস্টেমটি মোটামুটি সৎভাবে ক্যালিব্রেটেড, কিন্তু নিখুঁত নয় — বাস্তব সিস্টেমের মতোই)। আমরা naive always-accept নীতিকে একটি থ্রেশহোল্ড নীতি (থ্রেশহোল্ড = ০.৮০) এর সাথে তুলনা করব।

Python
import random
random.seed(21)

N = 200

def generate_predictions(n):
    items = []
    for _ in range(n):
        confidence = random.uniform(0.50, 1.00)
        correct = random.random() < confidence
        items.append((confidence, correct))
    return items

items = generate_predictions(N)

# নীতি ১: naive -- AI-এর পরামর্শ সবসময় সরাসরি গ্রহণ করো
naive_wrong = sum(1 for conf, correct in items if not correct)
naive_error_rate = naive_wrong / N * 100

# নীতি ২: কনফিডেন্স-থ্রেশহোল্ড -- থ্রেশহোল্ডের উপরে অটো-অ্যাকসেপ্ট, নিচে হলে মানুষের রিভিউতে পাঠাও
THRESHOLD = 0.80
auto_accepted = [(conf, correct) for conf, correct in items if conf >= THRESHOLD]
routed_to_human = [(conf, correct) for conf, correct in items if conf < THRESHOLD]

auto_wrong = sum(1 for conf, correct in auto_accepted if not correct)
threshold_error_rate = (auto_wrong / len(auto_accepted) * 100) if auto_accepted else 0.0
coverage = len(auto_accepted) / N * 100

print(f"মোট আইটেম: {N}")
print(f"naive always-accept: ভুলের হার = {naive_error_rate:.1f}% ({naive_wrong}/{N} ভুল)")
print(f"থ্রেশহোল্ড নীতি (>= {THRESHOLD}): অটো-অ্যাকসেপ্টেড {len(auto_accepted)}/{N} ({coverage:.1f}% কভারেজ)")
print(f"  -> অটো-অ্যাকসেপ্টেডগুলোর ভুলের হার = {threshold_error_rate:.1f}% ({auto_wrong}/{len(auto_accepted)} ভুল)")
print(f"  -> মানুষের রিভিউতে পাঠানো হলো: {len(routed_to_human)}/{N} ({100-coverage:.1f}%)")

    
naive always-accept নীতিতে সব ২০০টি সিদ্ধান্তের মধ্যে ৪৮টি ভুল, অর্থাৎ ভুলের হার ২৪.০% — প্রতি চারটির একটি ভুল, অথচ ব্যবহারকারী কখনো বুঝবেন না কোনটি। থ্রেশহোল্ড নীতিতে মাত্র ৮৫টি (৪২.৫%) সিদ্ধান্ত স্বয়ংক্রিয়ভাবে গৃহীত হয়েছে, এবং তার মধ্যে ভুল মাত্র ১২টি — ভুলের হার ১৪.১%-এ নেমে এসেছে, প্রায় ১০ পার্সেন্টেজ পয়েন্ট উন্নতি। বাকি ১১৫টি (৫৭.৫%) সিদ্ধান্ত মানুষের রিভিউতে পাঠানো হয়েছে — এখানেই ট্রেড-অফ: কম স্বয়ংক্রিয়তা, কিন্তু যা স্বয়ংক্রিয় হচ্ছে তা অনেক বেশি নির্ভরযোগ্য।
মূল কথা · Key takeaway

থ্রেশহোল্ড ক্যালিব্রেশনের "জাদু" নয় — এটি একটি ট্রেড-অফ ডায়াল। থ্রেশহোল্ড খুব নিচে রাখলে (যেমন ০.৫০) নীতিটি প্রায় naive-এর সমান হয়ে যায় (ওভার-ট্রাস্টের ঝুঁকি ফিরে আসে); খুব উঁচুতে রাখলে (যেমন ০.৯৮) কভারেজ প্রায় শূন্যে নেমে যায় (আন্ডার-ট্রাস্ট — সিস্টেমের সুবিধা প্রায় ব্যবহারই হয় না)। সঠিক থ্রেশহোল্ড নির্ভর করে একটি ভুল-গ্রহণ করার খরচ বনাম একটি মানুষের-রিভিউয়ের খরচের তুলনার উপর — এটি নিজেই একটি প্রোডাক্ট সিদ্ধান্ত, একটি প্রযুক্তিগত ধ্রুবক নয়।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ একটি মেডিকেল-ডায়াগনসিস AI-এর জন্য থ্রেশহোল্ড কি একটি স্প্যাম-ফিল্টার AI-এর থ্রেশহোল্ডের চেয়ে বেশি নাকি কম হওয়া উচিত? কেন?

মেডিকেল-ডায়াগনসিসে সাধারণত অনেক বেশি থ্রেশহোল্ড দরকার, কারণ একটি ভুল-গ্রহণ করা সিদ্ধান্তের খরচ (রোগ মিস করা) অনেক বেশি, তাই কভারেজ কম হলেও ক্ষতি নেই — বেশি কেস মানুষের কাছে যাক। স্প্যাম-ফিল্টারে একটি ভুল সিদ্ধান্তের খরচ তুলনামূলক কম (একটি ইমেইল ভুল জায়গায় গেলে সহজে ঠিক করা যায়), তাই কম থ্রেশহোল্ডেও বেশি স্বয়ংক্রিয়তা গ্রহণযোগ্য। এটাই দেখায় থ্রেশহোল্ড একটি সর্বজনীন সংখ্যা নয়, প্রেক্ষাপট-নির্ভর সিদ্ধান্ত (M2, M7-এ "high-stakes contexts"-এ বিস্তারিত)।

প্র ০২ উপরের ডেমোতে সিস্টেমটি "মোটামুটি সৎভাবে ক্যালিব্রেটেড" বলা হয়েছে (সঠিক হওয়ার সম্ভাবনা = কনফিডেন্স স্কোর)। বাস্তব জীবনে যদি সিস্টেমের কনফিডেন্স স্কোর নিজেই ভুল হয়, তাহলে থ্রেশহোল্ড নীতির কী হবে?

যদি কনফিডেন্স স্কোর প্রকৃত নির্ভুলতার সাথে সামঞ্জস্যপূর্ণ না হয় (যেমন সিস্টেম সবসময় "০.৯৫" দেখায় আসল নির্ভুলতা যাই হোক না কেন), তাহলে থ্রেশহোল্ড নীতি সম্পূর্ণ অকার্যকর হয়ে যায় — কারণ থ্রেশহোল্ড নিজেই একটি ভুল সিগন্যালের উপর ভিত্তি করে সিদ্ধান্ত নিচ্ছে। এটাই দেখায় কেন কনফিডেন্স স্কোরের নিজস্ব ক্যালিব্রেশন যাচাই করা (predicted confidence বনাম actual accuracy তুলনা করা) সমান গুরুত্বপূর্ণ — এই বিষয়টি M4-এ কনফিডেন্স কমিউনিকেশনে আরও বিস্তারিত।

প্র ০৩ থ্রেশহোল্ড নীতিতে "মানুষের রিভিউতে পাঠানো" মানে কি সেই কেসগুলো স্বয়ংক্রিয়ভাবে ঠিক হয়ে যাবে?

না — উপরের ডেমো ধরে নিয়েছে মানুষ রিভিউ করলে ভুল ধরা পড়বে, কিন্তু বাস্তবে মানুষও ভুল করতে পারেন, বিশেষত ক্লান্তি বা কম-স্টেকের অনুভূতির কারণে রিভিউ কম মনোযোগ দিয়ে করলে। এটাই ঠিক L11-এর বিষয় — অটোমেশন বায়াস, যেখানে মানুষের "যাচাই" নিজেই ধীরে ধীরে দুর্বল হয়ে যেতে পারে।

অনুশীলন

  1. চিন্তা করুন: উপরের কোডে THRESHOLD-কে ০.৮০ থেকে ০.৯০-এ বাড়ালে অটো-অ্যাকসেপ্টেড সংখ্যা (কভারেজ) এবং সেই সেটের ভুলের হার — দুটোই কি কমবে, নাকি একটা বাড়বে আরেকটা কমবে?

    থ্রেশহোল্ড বাড়ালে কম আইটেম শর্ত পূরণ করবে, তাই কভারেজ কমবে। কিন্তু যেসব আইটেম এখনও অটো-অ্যাকসেপ্ট হচ্ছে সেগুলোর গড় কনফিডেন্স বেশি, তাই সেগুলোর ভুলের হার আরও কমার কথা — এই দুটো একসাথে ঘটবে (কভারেজ ↓, ভুলের হার ↓), একসাথে বাড়া-কমা নয়।

  2. পরীক্ষা করুন: উপরের কোডে THRESHOLD = 0.80-কে THRESHOLD = 0.90-এ পরিবর্তন করে Run চেপে আপনার অনুমান যাচাই করুন।

    THRESHOLD=0.90-এ অটো-অ্যাকসেপ্টেড সংখ্যা কমে ৪৩/২০০ (২১.৫%)-এ নেমে আসে, এবং সেই সেটের ভুলের হার আরও কমে ৯.৩% (৪/৪৩)-এ পৌঁছায় — ঠিক অনুমান অনুযায়ী কভারেজ ও ভুলের হার একসাথে কমেছে (থ্রেশহোল্ড ০.৮০-এর তুলনায় কভারেজ ৪২.৫% থেকে ২১.৫%-এ, ভুলের হার ১৪.১% থেকে ৯.৩%-এ)। এটি নিশ্চিত করে থ্রেশহোল্ড বাড়ানো নির্ভুলতা কেনার একটি সরাসরি উপায়, কিন্তু কভারেজ বিনিময়ে দিতে হয়।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • পরবর্তী পাঠ L11 অটোমেশন বায়াস ও কমপ্লেসেন্সি — কেন "মানুষ রিভিউ করবে" ধরে নেওয়াই যথেষ্ট নয়, একটি সত্যিকারের সিমুলেশনসহ।
  • আগের পাঠে ফিরে যান L09 ট্রাস্ট কী এবং পারসিভড রিলায়াবিলিটি বনাম প্রকৃত রিলায়াবিলিটির গ্যাপ কীভাবে তৈরি হয়।
  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ ট্রাস্ট ক্যালিব্রেশন, এক্সপ্লেইনেবিলিটি, হিউম্যান-ইন-দ্য-লুপ ডিজাইন, কগনিটিভ লোড, অ্যাক্সেসিবিলিটি, হিউম্যান-AI টিমিং, ইউজেবিলিটি ইভালুয়েশন, ইন্ডাস্ট্রি ফ্রেমওয়ার্ক ও ক্যাপস্টোন।
আগের পাঠ
ট্রাস্ট কী, এবং কেন তা ভেঙে যায়