পাঠ ৫৫ · ৫৭-এর মধ্যে · মডিউল ১৩
Home / Courses / Ethics in Computing & AI Safety / কেস স্টাডি

কেস স্টাডি: একটি সম্পূর্ণ AI ডিপ্লয়মেন্ট এথিক্স রিভিউ

Case study: a comprehensive AI deployment ethics review
১৪ মিনিট পড়া উন্নত · Advanced Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • একটি বাস্তবসম্মত AI ডিপ্লয়মেন্ট এথিক্স রিভিউ কীভাবে ধাপে ধাপে চালানো হয়
  • স্টেকহোল্ডার বিশ্লেষণ, ফেয়ারনেস মেট্রিক্স, ও k-anonymity প্যাটার্নগুলো একটি একক পরিস্থিতিতে কীভাবে একসাথে প্রয়োগ করা যায়
  • কেন শুধু একটি মেট্রিক (যেমন সামগ্রিক accuracy) যথেষ্ট নয় — গ্রুপভেদে ভিন্ন ভিন্ন মেট্রিক্স আলাদা তথ্য দেয়
  • একটি সংক্ষিপ্ত গভর্নেন্স রিভিউ নোট কী কী প্রশ্ন তোলে, এমনকি পরিমাণগত চেকগুলো সম্পন্ন হওয়ার পরেও

১ · পরিস্থিতি — একটি হাইপোথেটিক্যাল AI ডিপ্লয়মেন্ট

নিচের পুরো কেস স্টাডিটি সম্পূর্ণ হাইপোথেটিক্যাল ও ইলাস্ট্রেটিভ — "স্ক্রিনফ্লো টেক" নামে বাস্তবে কোনো কোম্পানির অস্তিত্ব নেই বলে ABCL TECH-এর জানামতে, এবং "স্ক্রিনস্মার্ট" কোনো প্রকৃত প্রোডাক্ট নয়। ধরা যাক স্ক্রিনফ্লো টেক একটি রিজিউমি-স্ক্রিনিং AI টুল তৈরি করেছে যা ক্লায়েন্ট কোম্পানিগুলোর হয়ে আবেদনকারীদের রিজিউমি পড়ে স্বয়ংক্রিয়ভাবে "ইন্টারভিউর জন্য সুপারিশ" বা "বাদ" — এই দুই ভাগে ভাগ করে। বৃহৎ পরিসরে রোলআউটের আগে, আমরা একজন অভ্যন্তরীণ এথিক্স রিভিউয়ারের ভূমিকায় থেকে টুলটি চারটি ধাপে যাচাই করবো।

১. স্টেকহোল্ডার বিশ্লেষণ (M1) ২. ফেয়ারনেস চেক (M4) ৩. প্রাইভেসি / k-anonymity (M3) ৪. গভর্নেন্স রিভিউ নোট (M12)
চারটি ধাপ একসাথে মিলেই একটি সম্পূর্ণ এথিক্স রিভিউ তৈরি করে — শুধু একটি ধাপ দিয়ে কোনো সিস্টেমকে "নিরাপদ" ঘোষণা করা যায় না।
নিচের তিনটি কোড সেল একটি একক Pyodide সেশনে ক্রমানুসারে চলে — উপর থেকে নিচে Run করুন। প্রতিটি সেল স্বয়ংসম্পূর্ণ একটি ছোট সিন্থেটিক ডেটাসেট সংজ্ঞায়িত করে ও তার উপর সত্যিকারের গণনা চালায়।

২ · ধাপ ১ — স্টেকহোল্ডার বিশ্লেষণ

প্রথমেই আমরা M1/L03-এর ধাঁচে (এখানে স্বয়ংসম্পূর্ণভাবে পুনর্নির্মিত) স্ক্রিনস্মার্ট দ্বারা প্রভাবিত প্রধান গোষ্ঠীগুলো শনাক্ত করি — চাকরি আবেদনকারী, ক্লায়েন্ট কোম্পানি, বিদ্যমান HR স্টাফ, ও বৃহত্তর শ্রমবাজার/সমাজ — এবং প্রতিটি গোষ্ঠীর জন্য চারটি মাত্রায় (আর্থিক, স্বায়ত্তশাসন, প্রাইভেসি, সেফটি) একটি ইলাস্ট্রেটিভ ইমপ্যাক্ট স্কোর (-৫ থেকে +৫) বসিয়ে, গোষ্ঠীর আকার/গুরুত্বের সাপেক্ষে একটি ওয়েট দিয়ে একটি ওয়েটেড গড় স্কোর গণনা করি।

Python
# ========== ধাপ ১: স্টেকহোল্ডার ইমপ্যাক্ট ম্যাট্রিক্স -- সম্পূর্ণ সিন্থেটিক/ইলাস্ট্রেটিভ ==========
stakeholders = [
    {"name": "চাকরি আবেদনকারী",        "weight": 0.50, "financial": -3, "autonomy": -4, "privacy": -3, "safety": 0},
    {"name": "ক্লায়েন্ট কোম্পানি",       "weight": 0.25, "financial":  4, "autonomy":  2, "privacy":  0, "safety": 0},
    {"name": "HR স্টাফ",                "weight": 0.15, "financial":  1, "autonomy": -1, "privacy":  0, "safety": 0},
    {"name": "বৃহত্তর শ্রমবাজার/সমাজ",   "weight": 0.10, "financial":  0, "autonomy": -1, "privacy": -1, "safety": 0},
]

DIMENSIONS = ["financial", "autonomy", "privacy", "safety"]

def weighted_impact(stakeholder):
    mean_score = sum(stakeholder[d] for d in DIMENSIONS) / len(DIMENSIONS)
    return mean_score, mean_score * stakeholder["weight"]

print(f"{'স্টেকহোল্ডার':22s} {'গড় ইমপ্যাক্ট':>14s} {'ওয়েট':>8s} {'ওয়েটেড স্কোর':>14s}")
results = []
for s in stakeholders:
    mean_score, weighted = weighted_impact(s)
    results.append((s["name"], mean_score, s["weight"], weighted))
    print(f"{s['name']:22s} {mean_score:14.3f} {s['weight']:8.2f} {weighted:14.4f}")

most_affected = min(results, key=lambda r: r[3])
print(f"\nসবচেয়ে (নেতিবাচকভাবে) বেশি প্রভাবিত গোষ্ঠী: {most_affected[0]}  (ওয়েটেড স্কোর {most_affected[3]:.4f})")

    
Run করলে দেখা যাবে চাকরি আবেদনকারী গোষ্ঠীর ওয়েটেড স্কোর সবচেয়ে বেশি নেতিবাচক (−১.২৫), যদিও সংখ্যায় তারাই সবচেয়ে বড় গোষ্ঠী (ওয়েট ০.৫০)। এটিই কম্পিউটিং এথিক্সের একটি সাধারণ প্যাটার্ন — যে গোষ্ঠী সিস্টেম ডিজাইন করার প্রক্রিয়ায় সবচেয়ে কম উপস্থিত থাকে (আবেদনকারীদের সাধারণত ডিজাইন মিটিংয়ে আসন থাকে না), তারাই প্রায়ই সবচেয়ে বেশি প্রভাবিত হয়।

৩ · ধাপ ২ — বায়াস ও ফেয়ারনেস চেক

স্টেকহোল্ডার বিশ্লেষণ আমাদের বলে কারা প্রভাবিত হতে পারে, কিন্তু কীভাবে তা পরিমাপ করতে হয় ফেয়ারনেস মেট্রিক্স দিয়ে (M4/L16-এর প্যাটার্নে)। ধরা যাক স্ক্রিনস্মার্ট দুটি সিন্থেটিক ডেমোগ্রাফিক গ্রুপ (Group A, Group B) থেকে ১২ জন করে আবেদনকারীর উপর টেস্ট করা হয়েছে — predicted_positive মানে সিস্টেম ইন্টারভিউর জন্য সুপারিশ করেছে, actual_positive মানে (হাইপোথেটিক্যালি, পরবর্তীতে জানা) প্রার্থী সত্যিই ভূমিকায় উপযুক্ত ছিলেন।

Python
# ========== ধাপ ২: ফেয়ারনেস মেট্রিক্স -- দুটি সিন্থেটিক ডেমোগ্রাফিক গ্রুপে ==========
group_a = [
    {"id": "A1", "predicted_positive": True,  "actual_positive": True},
    {"id": "A2", "predicted_positive": True,  "actual_positive": True},
    {"id": "A3", "predicted_positive": True,  "actual_positive": False},
    {"id": "A4", "predicted_positive": True,  "actual_positive": True},
    {"id": "A5", "predicted_positive": True,  "actual_positive": False},
    {"id": "A6", "predicted_positive": True,  "actual_positive": True},
    {"id": "A7", "predicted_positive": False, "actual_positive": False},
    {"id": "A8", "predicted_positive": False, "actual_positive": False},
    {"id": "A9", "predicted_positive": False, "actual_positive": True},
    {"id": "A10","predicted_positive": False, "actual_positive": False},
    {"id": "A11","predicted_positive": False, "actual_positive": False},
    {"id": "A12","predicted_positive": False, "actual_positive": False},
]

group_b = [
    {"id": "B1", "predicted_positive": True,  "actual_positive": True},
    {"id": "B2", "predicted_positive": True,  "actual_positive": False},
    {"id": "B3", "predicted_positive": True,  "actual_positive": False},
    {"id": "B4", "predicted_positive": True,  "actual_positive": True},
    {"id": "B5", "predicted_positive": False, "actual_positive": False},
    {"id": "B6", "predicted_positive": False, "actual_positive": False},
    {"id": "B7", "predicted_positive": False, "actual_positive": True},
    {"id": "B8", "predicted_positive": False, "actual_positive": True},
    {"id": "B9", "predicted_positive": False, "actual_positive": False},
    {"id": "B10","predicted_positive": False, "actual_positive": False},
    {"id": "B11","predicted_positive": False, "actual_positive": False},
    {"id": "B12","predicted_positive": False, "actual_positive": False},
]

def fairness_metrics(records, label):
    n = len(records)
    positives_predicted = [r for r in records if r["predicted_positive"]]
    actual_pos = [r for r in records if r["actual_positive"]]
    actual_neg = [r for r in records if not r["actual_positive"]]

    dp_rate = len(positives_predicted) / n

    fp = [r for r in records if r["predicted_positive"] and not r["actual_positive"]]
    fpr = len(fp) / len(actual_neg) if actual_neg else 0.0

    fn = [r for r in records if not r["predicted_positive"] and r["actual_positive"]]
    fnr = len(fn) / len(actual_pos) if actual_pos else 0.0

    correct = [r for r in records if r["predicted_positive"] == r["actual_positive"]]
    accuracy = len(correct) / n

    calib_pos = (sum(1 for r in positives_predicted if r["actual_positive"]) / len(positives_predicted)
                 if positives_predicted else 0.0)

    print(f"--- {label} (n={n}) ---")
    print(f"  ডেমোগ্রাফিক প্যারিটি (positive prediction rate): {dp_rate:.3f}")
    print(f"  False Positive Rate:                             {fpr:.3f}")
    print(f"  False Negative Rate:                             {fnr:.3f}")
    print(f"  সামগ্রিক accuracy:                                {accuracy:.3f}")
    print(f"  ক্যালিব্রেশন (predicted-positive-দের মধ্যে actual positive rate): {calib_pos:.3f}")
    return {"dp_rate": dp_rate, "fpr": fpr, "fnr": fnr, "accuracy": accuracy, "calibration": calib_pos}

metrics_a = fairness_metrics(group_a, "Group A")
print()
metrics_b = fairness_metrics(group_b, "Group B")

dp_gap = abs(metrics_a["dp_rate"] - metrics_b["dp_rate"])
fnr_gap = abs(metrics_a["fnr"] - metrics_b["fnr"])
print(f"\nডেমোগ্রাফিক প্যারিটি ফারাক: {dp_gap:.3f}  ({dp_gap*100:.1f} পার্সেন্টেজ পয়েন্ট)")
print(f"False Negative Rate ফারাক: {fnr_gap:.3f}  ({fnr_gap*100:.1f} পার্সেন্টেজ পয়েন্ট)")

    
গণনা করা ফলাফল: Group A-কে ৫০% ইন্টারভিউর জন্য সুপারিশ করা হয়, Group B-কে মাত্র ৩৩.৩% — একটি ১৬.৭ পার্সেন্টেজ-পয়েন্ট ডেমোগ্রাফিক-প্যারিটি ফারাক। আরও চিন্তার বিষয়, Group B-এর False Negative Rate ৫০% (Group A-এর ২০%-এর তুলনায়) — অর্থাৎ Group B-এর যোগ্য প্রার্থীরা অনুপাতে অনেক বেশি ভুলভাবে বাদ পড়ছেন। সামগ্রিক accuracy (A: ০.৭৫, B: ০.৬৭) খুব বেশি না হলেও কাছাকাছি হওয়া সত্ত্বেও এই গ্রুপভেদে ভিন্ন ভিন্ন ত্রুটির প্যাটার্ন লুকিয়ে থাকে — এই টেনশনটিই L19-এর "পারফেক্ট ফেয়ারনেসের অসম্ভবতা" আলোচনার মূল বিষয়।

৪ · ধাপ ৩ — প্রাইভেসি বিবেচনা: k-anonymity চেক

পরবর্তী প্রশ্ন হলো স্ক্রিনস্মার্টের ট্রেনিং-ডেটাতে ব্যবহৃত রেকর্ডগুলো কতটা re-identify করা সহজ (M3/L12-এর প্যাটার্নে)। নিচে ১৫টি সিন্থেটিক ট্রেনিং রেকর্ডের তিনটি কোয়াসি-আইডেন্টিফায়ার — বয়স-ব্র্যাকেট, সম্পূর্ণ ৫-সংখ্যার zip কোড, ও লিঙ্গ — দিয়ে k-anonymityk-anonymityএকটি ডেটাসেট k-anonymous যদি প্রতিটি কোয়াসি-আইডেন্টিফায়ার সমন্বয়ের গ্রুপে কমপক্ষে k জন রেকর্ড থাকে। চেক করা হবে।

Python
# ========== ধাপ ৩: k-anonymity চেক -- ট্রেনিং ডেটার কোয়াসি-আইডেন্টিফায়ারে ==========
training_records = [
    {"age_bracket": "20-29", "zip5": "10001", "gender": "F"},
    {"age_bracket": "20-29", "zip5": "10001", "gender": "F"},
    {"age_bracket": "20-29", "zip5": "10002", "gender": "F"},
    {"age_bracket": "20-29", "zip5": "10003", "gender": "M"},
    {"age_bracket": "30-39", "zip5": "10001", "gender": "M"},
    {"age_bracket": "30-39", "zip5": "10001", "gender": "M"},
    {"age_bracket": "30-39", "zip5": "10002", "gender": "M"},
    {"age_bracket": "30-39", "zip5": "10002", "gender": "F"},
    {"age_bracket": "40-49", "zip5": "10001", "gender": "F"},
    {"age_bracket": "40-49", "zip5": "10001", "gender": "F"},
    {"age_bracket": "40-49", "zip5": "10003", "gender": "M"},
    {"age_bracket": "20-29", "zip5": "10002", "gender": "M"},
    {"age_bracket": "30-39", "zip5": "10003", "gender": "F"},
    {"age_bracket": "40-49", "zip5": "10002", "gender": "M"},
    {"age_bracket": "20-29", "zip5": "10001", "gender": "M"},
]

def group_sizes(records, quasi_id_fields):
    groups = {}
    for r in records:
        key = tuple(r[f] for f in quasi_id_fields)
        groups.setdefault(key, []).append(r)
    return {k: len(v) for k, v in groups.items()}

def check_k_anonymity(records, quasi_id_fields, k, label):
    sizes = group_sizes(records, quasi_id_fields)
    min_size = min(sizes.values())
    violating = sum(1 for size in sizes.values() if size < k)
    satisfied = min_size >= k
    print(f"--- {label} ---")
    print(f"  কোয়াসি-আইডেন্টিফায়ার: {quasi_id_fields}")
    print(f"  মোট গ্রুপ সংখ্যা: {len(sizes)},  সর্বনিম্ন গ্রুপ সাইজ: {min_size}")
    print(f"  k={k} লঙ্ঘনকারী গ্রুপ সংখ্যা: {violating}")
    print(f"  k={k}-anonymity satisfied: {satisfied}")
    return min_size, satisfied

K = 3
print("ধাপ A: মূল, জেনারালাইজ না করা কোয়াসি-আইডেন্টিফায়ার (বয়স-ব্র্যাকেট + সম্পূর্ণ zip + লিঙ্গ)")
min_a, ok_a = check_k_anonymity(training_records, ["age_bracket", "zip5", "gender"], K, "ধাপ A -- মূল ডেটা")

print("\nধাপ B: zip জেনারালাইজেশন (৫-সংখ্যা -> প্রথম ৩ সংখ্যা), লিঙ্গ এখনো রাখা হয়েছে")
generalized = [dict(r, zip3=r["zip5"][:3]) for r in training_records]
min_b, ok_b = check_k_anonymity(generalized, ["age_bracket", "zip3", "gender"], K, "ধাপ B -- zip3 + gender")

print("\nধাপ C: zip3 জেনারালাইজেশন + লিঙ্গ ফিল্ড সম্পূর্ণ বাদ দেওয়া")
min_c, ok_c = check_k_anonymity(generalized, ["age_bracket", "zip3"], K, "ধাপ C -- শুধু age_bracket + zip3")

print(f"\nসারসংক্ষেপ: সর্বনিম্ন গ্রুপ সাইজ ধাপ A-তে {min_a} -> ধাপ B-তে {min_b} -> ধাপ C-তে {min_c}")

    
গণনা করা ফলাফল: মূল ডেটায় ১২টি গ্রুপের মধ্যে সর্বনিম্ন গ্রুপ সাইজ মাত্র ১ (অনেক রেকর্ড একাই একটি সমন্বয়ে অনন্য — সহজে re-identify করা যায়, k=3 তো দূরের কথা, k=2-ও পূরণ হয় না)। zip জেনারালাইজ করলে (৫ সংখ্যা → ৩ সংখ্যা) সর্বনিম্ন গ্রুপ সাইজ ২-এ ওঠে — উন্নতি, তবুও k=3 পূরণ করে না। লিঙ্গ ফিল্ডও বাদ দিলে সর্বনিম্ন গ্রুপ সাইজ ৪-এ পৌঁছায়, যা k=3 পূরণ করে — কিন্তু তার মানে ডেটাসেট থেকে একটি পুরো তথ্য-মাত্রা (লিঙ্গ) হারানো, যা ডেটার উপযোগিতা ও প্রাইভেসির মধ্যে ক্লাসিক ট্রেড-অফের একটি বাস্তব উদাহরণ।

৫ · ধাপ ৪ — গভর্নেন্স রিভিউ নোট

পরিমাণগত চেকগুলো (ফেয়ারনেস, প্রাইভেসি) স্পষ্ট সমস্যা দেখায়, কিন্তু একটি সম্পূর্ণ রিভিউয়ে প্রক্রিয়াগত প্রশ্নগুলোও (M12-এর ধাঁচে) দেখতে হয় — এগুলো এই মুহূর্তে সংখ্যায় প্রকাশ করা কঠিন, তাই একটি সংক্ষিপ্ত নোট হিসেবে রাখা হলো (L56/L57-এ আমরা দেখব কীভাবে এই ধরনের প্রশ্নগুলোকে একটি পূর্ণাঙ্গ ওয়েটেড অডিট স্কোরে রূপান্তর করা যায়)।

মানুষের আপিল পথ
আংশিক — একজন প্রত্যাখ্যাত আবেদনকারী ইমেইল করে জিজ্ঞাসা করতে পারেন, কিন্তু কোনো আনুষ্ঠানিক, নথিভুক্ত রিভিউ প্রক্রিয়া নেই।
ডেটা রিটেনশন পলিসি
নথিভুক্ত নয় — প্রত্যাখ্যাত আবেদনকারীদের রিজিউমি কতদিন রাখা হবে তা স্পষ্ট নয়।
নিয়মিত ফেয়ারনেস অডিট
নেই — এই পাঠের ধাপ ২-এর মতো একটি চেক নিয়মিত সময়ান্তরে চালানোর কোনো শিডিউল নথিভুক্ত নেই।
দায়িত্বশীল টিম
আংশিক — একজন প্রোডাক্ট ম্যানেজার দায়ী হিসেবে চিহ্নিত, কিন্তু একটি ক্রস-ফাংশনাল গভর্নেন্স রিভিউ বোর্ড নেই।
মূল কথা · Key takeaway

এই কেস স্টাডি দেখায় একটি পূর্ণাঙ্গ এথিক্স রিভিউ কেন একটি একক চেকলিস্ট আইটেম নয় — এটি একাধিক লেন্সের সমন্বয়: কারা প্রভাবিত হয় (স্টেকহোল্ডার), কীভাবে অন্যায্যভাবে প্রভাবিত হয় (ফেয়ারনেস), কতটা ব্যক্তিগত তথ্য ঝুঁকিতে আছে (প্রাইভেসি), এবং সিদ্ধান্ত নেওয়ার প্রক্রিয়াটি কতটা জবাবদিহিমূলক (গভর্নেন্স)। এই চারটির যেকোনো একটি বাদ দিলে একটি গুরুত্বপূর্ণ সমস্যা অদৃশ্য থেকে যেতে পারে। পরের পাঠে (L56) আমরা এই একই ধরনের চেকগুলোকে একটি পুনঃব্যবহারযোগ্য ফ্রেমওয়ার্কে রূপান্তর করবো যা আপনি নিজের যেকোনো প্রজেক্টে সরাসরি প্রয়োগ করতে পারবেন।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ ধাপ ১-এর স্টেকহোল্ডার বিশ্লেষণ একাই কি ধাপ ২-এ পাওয়া নির্দিষ্ট False Negative Rate ফারাকটি ধরতে পারতো?

না। স্টেকহোল্ডার বিশ্লেষণ বলে আবেদনকারীরা সবচেয়ে বেশি প্রভাবিত গোষ্ঠী — কিন্তু এটি বলে না তাদের মধ্যে কোনো উপগোষ্ঠী (যেমন Group B) অন্যদের চেয়ে বেশি ভুলভাবে বাদ পড়ছে। সেই তথ্যটি শুধুমাত্র গ্রুপভেদে প্রকৃত পূর্বাভাস ডেটার উপর সত্যিকারের গণনা চালিয়েই পাওয়া যায় — এটিই দেখায় কেন স্টেকহোল্ডার বিশ্লেষণ ও ফেয়ারনেস মেট্রিক্স একে অপরের বিকল্প নয়, বরং পরিপূরক।

প্র ০২ ধাপ ৩-এর k-anonymity অগ্রগতি (১ → ২ → ৪) কী দেখায় ডেটা-উপযোগিতা ও প্রাইভেসির মধ্যে ট্রেড-অফ নিয়ে?

প্রতিটি জেনারালাইজেশন ধাপ (zip সংক্ষিপ্ত করা, লিঙ্গ বাদ দেওয়া) প্রাইভেসি বাড়ায় (গ্রুপ সাইজ বাড়ে, re- identification কঠিন হয়) কিন্তু ডেটার নির্দিষ্টতা/উপযোগিতা কমায় (একটি পুরো তথ্য-মাত্রা হারানো)। k=3 পূরণ করার জন্য লিঙ্গ ফিল্ড সম্পূর্ণ বাদ দিতে হলো — অর্থাৎ যদি ভবিষ্যতে লিঙ্গ-নির্দিষ্ট ফেয়ারনেস বিশ্লেষণ (যেমন ধাপ ২-এর মতো) দরকার হয়, সেই তথ্য এই জেনারালাইজড ডেটাসেটে আর সরাসরি পাওয়া যাবে না — একটি বাস্তব, কখনো কখনো কঠিন সিদ্ধান্ত।

প্র ০৩ যদি ডেমোগ্রাফিক প্যারিটি ফারাক প্রতিষ্ঠানের নির্ধারিত সীমার মধ্যে থাকতো, কিন্তু FNR ফারাক না থাকতো, তাহলে কি সিস্টেমটি একটি ফেয়ারনেস রিভিউ "পাস" করতো?

নির্ভর করে কোন ফেয়ারনেস সংজ্ঞাকে প্রতিষ্ঠান গুরুত্বপূর্ণ মনে করে তার উপর — এবং এখানেই সমস্যা: ডেমোগ্রাফিক প্যারিটি ও FNR সমতা আলাদা আলাদা প্রশ্নের উত্তর দেয় ("একই হারে সুপারিশ করা হচ্ছে কি?" বনাম "যোগ্য প্রার্থীদের একই হারে ভুলভাবে বাদ দেওয়া হচ্ছে কি?"), আর সাধারণ বেস-রেট ভিন্নতায় দুটো একসাথে নিখুঁতভাবে পূরণ করা গাণিতিকভাবে কঠিন হতে পারে (L19-এ বিস্তারিত)। তাই একটি মেট্রিক্স "পাস" করলেই সিস্টেমটি সব অর্থে ন্যায্য — এমন সিদ্ধান্তে আসা যায় না।

অনুশীলন

  1. চিন্তা করুন: ধাপ ১-এর স্টেকহোল্ডার তালিকায় কোন গোষ্ঠীটি অনুপস্থিত থাকতে পারে — যেমন যারা AI-চালিত স্ক্রিনিং সম্পর্কে জেনে আগে থেকেই আবেদন করা থেকে বিরত থাকেন? তাদের অন্তর্ভুক্ত করলে বিশ্লেষণ কীভাবে বদলাতে পারে?

    এই "নিরুৎসাহিত সম্ভাব্য আবেদনকারী" গোষ্ঠী স্টেকহোল্ডার তালিকায় সাধারণত সম্পূর্ণ অনুপস্থিত থাকে কারণ তারা কখনো সিস্টেমের সাথে মিথস্ক্রিয়াই করেন না — কোনো ডেটাপয়েন্ট তৈরি হয় না, তাই কোনো মেট্রিক্সেও ধরা পড়ে না। তাদের অন্তর্ভুক্ত করলে দেখা যেতে পারে প্রকৃত প্রভাব ধাপ ২-এর ফেয়ারনেস মেট্রিক্সে দেখা সংখ্যাগুলোর চেয়েও বড়, কারণ যারা ইতিমধ্যে সিস্টেম নিয়ে অবিশ্বাসের কারণে আবেদনই করেননি তারা কোনো পরিসংখ্যানেই ধরা পড়েন না।

  2. পরীক্ষা করুন: ধাপ ২-এর কোড সেলে group_b-তে B7-এর predicted_positive-কে False থেকে True-তে বদলে Run করুন — FNR ও ডেমোগ্রাফিক প্যারিটি কীভাবে বদলায়?

    B7 এখন predicted=True, actual=True হয়ে যাবে — তাই এটি আর false negative থাকবে না, শুধু একটি সঠিক positive prediction হবে। Group B-এর false negative সংখ্যা ২ থেকে ১-এ নামবে (শুধু B8 বাকি থাকবে), তাই FNR হবে 1/3 ≈ 0.333 (আগের ০.৫ থেকে কমে) — একটি উন্নতি। একই সাথে positives_predicted সংখ্যা ৪ থেকে ৫-এ বাড়ায় ডেমোগ্রাফিক প্যারিটি রেট 5/12 ≈ 0.417-এ উঠবে (আগের ০.৩৩৩ থেকে বেড়ে) — Group A-এর ০.৫-এর সাথে ফারাক কমে আসবে। এটি দেখায় দুটি মেট্রিক্স কীভাবে একসাথে নড়াচড়া করতে পারে যখন একটি ডেটাপয়েন্ট বদলানো হয়।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

আগের পাঠ
গ্লোবাল পলিসি চ্যালেঞ্জ — একটি তুলনামূলক দৃষ্টিভঙ্গি