পাঠ ১৫ · ৫৭-এর মধ্যে · মডিউল ৪
Home / AI Courses / AI Ethics / প্রাইভেসি ও ডেটা এথিক্স

কনসেন্ট, ডেটা মিনিমাইজেশন ও পারপাস লিমিটেশন

Consent, data minimization & purpose limitation
৯ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • তিনটি মূল ডেটা-এথিক্স নীতি — কনসেন্ট, ডেটা মিনিমাইজেশন, পারপাস লিমিটেশন — এবং তাদের সংজ্ঞা
  • কেন AI-তে "পারপাস লিমিটেশন" বিশেষভাবে ভঙ্গুর — একটি মডেল রি-ট্রেইন করা কতটা সহজ
  • একটি সত্যিকারের ওজন-ভিত্তিক কমপ্লায়েন্স-স্কোরার — একাধিক সিনারিওতে প্রয়োগ করে দেখা
  • এই নীতিগুলো পরবর্তী পাঠে (GDPR, L37) কীভাবে আইনি কাঠামোতে রূপ নিয়েছে তার একটি প্রাথমিক ইঙ্গিত

১ · তিনটি মূল নীতি

কনসেন্ট
ব্যবহারকারী স্পষ্টভাবে জেনে ও বুঝে রাজি হয়েছেন যে তার ডেটা একটি নির্দিষ্ট উদ্দেশ্যে ব্যবহৃত হবে। একটি দীর্ঘ, অস্পষ্ট Terms-of-Service-এর নিচে চাপা "Accept" বাটন প্রকৃত informed consent নাও হতে পারে।
ডেটা মিনিমাইজেশন
উদ্দেশ্যের জন্য যতটুকু ডেটা প্রকৃতপক্ষে দরকার শুধু ততটুকুই সংগ্রহ করা — "ভবিষ্যতে হয়তো কাজে লাগবে" এই যুক্তিতে বাড়তি ডেটা জমা করা এই নীতির সরাসরি লঙ্ঘন।
পারপাস লিমিটেশন
ডেটা যে নির্দিষ্ট উদ্দেশ্যে সংগ্রহ করা হয়েছিল শুধু সেই উদ্দেশ্যেই ব্যবহার করা — নতুন, ভিন্ন উদ্দেশ্যের জন্য নতুন কনসেন্ট প্রয়োজন হয়।

২ · AI-নির্দিষ্ট ঝুঁকি — "পারপাস ক্রিপ"

AI-তে পারপাস লিমিটেশন বিশেষভাবে ভঙ্গুর, কারণ একটি ডেটাসেট একবার সংগ্রহ করা হলে সেটি দিয়ে সম্পূর্ণ নতুন একটি মডেল ট্রেইন করা প্রযুক্তিগতভাবে অত্যন্ত সহজ — নতুন করে ডেটা সংগ্রহ করার প্রয়োজন হয় না। উদাহরণস্বরূপ, একটি ফিটনেস-অ্যাপ ব্যবহারকারীর সম্মতি নিয়ে হাঁটার-প্যাটার্ন ডেটা সংগ্রহ করলো "ব্যক্তিগত ফিটনেস পরামর্শ" দেওয়ার জন্য। পরে কোম্পানি সেই একই ডেটা ব্যবহার করে একটি বীমা-ঝুঁকি-স্কোরিং মডেল ট্রেইন করলো — ব্যবহারকারী কখনো এই দ্বিতীয় উদ্দেশ্যে সম্মতি দেননি। প্রযুক্তিগতভাবে এটি করা সহজ বলেই এটি নৈতিকভাবে গ্রহণযোগ্য নয় — এটাই "পারপাস ক্রিপ" (purpose creep)।

Ethics in Computing & AI Safety কোর্সের সাথে সম্পর্ক

Ethics in Computing & AI Safety সাধারণ ডেটা-প্রাইভেসি নীতিগুলো সংক্ষিপ্তভাবে কভার করে — এই কোর্স নির্দিষ্টভাবে AI মডেল-ট্রেনিং-এর প্রেক্ষাপটে এই নীতিগুলো কীভাবে প্রযোজ্য হয় তা গভীরে যায়।

৩ · একটি সত্যিকারের ডেমো — ওজন-ভিত্তিক কমপ্লায়েন্স স্কোরার

নিচের কোডে চারটি মানদণ্ড ("কনসেন্ট সঠিক উদ্দেশ্যের জন্য নেওয়া হয়েছে", "ডেটা প্রয়োজনের তুলনায় মিনিমাইজড", "পারপাস লিমিটেশন মানা হয়েছে", "রিটেনশন/ডিলিশন সীমিত") — প্রতিটির একটি ওজন (মোট ১.০) নিয়ে তিনটি বাস্তবসম্মত সিনারিওতে প্রয়োগ করে একটি প্রকৃত স্কোর গণনা করা হয়েছে।

Python
CRITERIA_WEIGHTS = {
    "consent_for_stated_purpose": 0.30,
    "data_minimized": 0.25,
    "purpose_limitation_respected": 0.30,
    "retention_limited": 0.15,
}
assert abs(sum(CRITERIA_WEIGHTS.values()) - 1.0) < 1e-9

scenarios = {
    "email_marketing_reused_for_credit_model": {
        "consent_for_stated_purpose": True,     # ইমেইল-মার্কেটিং-এর জন্য সঠিকভাবে কনসেন্ট নেওয়া হয়েছিল
        "data_minimized": True,                 # শুধু প্রয়োজনীয় ইমেইল-এনগেজমেন্ট ডেটাই নেওয়া হয়েছিল
        "purpose_limitation_respected": False,   # কিন্তু পরে নতুন কনসেন্ট ছাড়াই ক্রেডিট-রিস্ক মডেলে ব্যবহার করা হয়েছে
        "retention_limited": True,
    },
    "symptom_tracker_ai_feature": {
        "consent_for_stated_purpose": True,
        "data_minimized": True,
        "purpose_limitation_respected": True,
        "retention_limited": True,
    },
    "flashlight_app_broad_ad_ai": {
        "consent_for_stated_purpose": False,     # কনসেন্ট থাকলেও অস্পষ্ট/অতি-বিস্তৃত ভাষায় লুকানো
        "data_minimized": False,                 # ফাংশনের প্রয়োজনের চেয়ে অনেক বেশি ডেটা (কন্টাক্ট, লোকেশন, ক্যামেরা) চাওয়া
        "purpose_limitation_respected": False,   # সংগৃহীত ডেটা বিজ্ঞাপন-পারসোনালাইজেশন AI-তে অবাধে ব্যবহার
        "retention_limited": False,              # সীমাহীন সময় ধরে সংরক্ষণ, ডিলিশনের কোনো ব্যবস্থা নেই
    },
}

PASS_THRESHOLD = 0.85

def score_scenario(flags):
    return sum(CRITERIA_WEIGHTS[k] for k, v in flags.items() if v)

print(f"{'সিনারিও':42s} {'স্কোর':>7s}   ফলাফল")
print("-" * 70)
for name, flags in scenarios.items():
    score = score_scenario(flags)
    verdict = "PASS" if score >= PASS_THRESHOLD else "FAIL"
    failed = [k for k, v in flags.items() if not v]
    extra = f"  (ব্যর্থ মানদণ্ড: {', '.join(failed)})" if failed else ""
    print(f"{name:42s} {score:7.2f}   {verdict}{extra}")

    
লক্ষ্য করুন — প্রথম সিনারিওতে (email marketing → credit model) মাত্র একটি মানদণ্ড ব্যর্থ হয়েছে (purpose_limitation_respected), তবুও সেই একটি মানদণ্ডের ওজন (০.৩০) যথেষ্ট বড় হওয়ায় স্কোর PASS থ্রেশহোল্ডের নিচে নেমে গেছে। এটাই দেখায় — "বাকি সবকিছু ঠিকঠাক করেছি" যুক্তিটি পারপাস লিমিটেশনের মতো একটি মৌলিক নীতি লঙ্ঘনকে ক্ষমা করে না।
মূল কথা · Key takeaway

কনসেন্ট, ডেটা মিনিমাইজেশন ও পারপাস লিমিটেশন — তিনটিই একসাথে কাজ করে একটি "ডেটা ব্যবহারের সীমানা" তৈরি করে। AI-তে এই সীমানা সবচেয়ে বেশি ভাঙে যখন একটি প্রশিক্ষিত মডেল বা সংগৃহীত ডেটাসেট নতুন কোনো, মূল উদ্দেশ্যের সাথে অসংশ্লিষ্ট প্রজেক্টে "পুনর্ব্যবহার" করা হয় — নতুন কনসেন্ট ছাড়াই।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ একটি কোম্পানি যুক্তি দিচ্ছে, "আমাদের Terms of Service-এ 'ডেটা যেকোনো ব্যবসায়িক উদ্দেশ্যে ব্যবহার করা হতে পারে' লেখা আছে, তাই আমরা এটি নতুন AI প্রজেক্টে ব্যবহার করতে পারি।" এই যুক্তির সমস্যা কী?

এত অস্পষ্ট, বিস্তৃত ভাষা প্রকৃত informed consent তৈরি করে না — ব্যবহারকারী যখন সম্মতি দিয়েছিলেন তখন তিনি কোনো নির্দিষ্ট উদ্দেশ্য সম্পর্কে জানতেন না, তাই সেই সম্মতি অর্থবহভাবে "সেই উদ্দেশ্যের" জন্য দেওয়া হয়নি বলা যায় না। পারপাস লিমিটেশনের চেতনা হলো নির্দিষ্টতা — একটি ক্যাচ-অল ক্লজ এই চেতনাকে ফাঁকি দেওয়ার একটি কৌশল মাত্র।

প্র ০২ উপরের কোডে PASS_THRESHOLD যদি 0.60-এ কমানো হতো, তাহলে তিনটি সিনারিওর ফলাফল কীভাবে বদলাতো?

প্রথম সিনারিও (email marketing → credit model)-এর স্কোর ০.৭০, যা ০.৬০-এর বেশি — তাই থ্রেশহোল্ড কমালে এটি PASS হয়ে যেত। এটাই দেখায় থ্রেশহোল্ড নির্ধারণ কতটা গুরুত্বপূর্ণ একটি নীতিগত সিদ্ধান্ত — খুব কম থ্রেশহোল্ড একটি গুরুতর পারপাস-লিমিটেশন লঙ্ঘনকে "পাস" করিয়ে দিতে পারে।

প্র ০৩ তৃতীয় সিনারিওতে (flashlight app) চারটি মানদণ্ডের মধ্যে সবগুলোই ব্যর্থ হয়েছে। বাস্তব জীবনে এই ধরনের অ্যাপ কেন এত ব্যাপকভাবে বিদ্যমান বলে আপনার মনে হয়?

একাধিক কারণ থাকতে পারে — ব্যবহারকারীরা প্রায়ই পারমিশন ডায়ালগ না পড়েই "Allow" চাপেন, যাচাই/এনফোর্সমেন্ট দুর্বল বা বিলম্বিত হতে পারে, এবং বাড়তি ডেটার একটি বাণিজ্যিক মূল্য থাকে (বিজ্ঞাপন-টার্গেটিং, পুনর্বিক্রয়) যা কোম্পানিকে ন্যূনতম ডেটা সংগ্রহের চেয়ে বেশি সংগ্রহ করতে উদ্বুদ্ধ করে। এই বাণিজ্যিক প্রণোদনা নিয়ে বিস্তারিত আলোচনা L17-এ (সার্ভেইল্যান্স ক্যাপিটালিজম) আসবে।

অনুশীলন

  1. চিন্তা করুন: উপরের কোডে যদি নতুন একটি মানদণ্ড যোগ করা হয় — "third_party_sharing_disclosed" (ওজন ০.১৫, এবং অন্য মানদণ্ডগুলোর ওজন সেই অনুযায়ী সমানুপাতে কমিয়ে মোট আবার ১.০ করতে হবে) — তাহলে এটি কীভাবে ফলাফলকে প্রভাবিত করতে পারে বলে আপনার ধারণা?

    একটি নতুন মানদণ্ড যোগ করলে প্রতিটি বিদ্যমান মানদণ্ডের ওজন কিছুটা কমে যাবে (যেহেতু মোট সবসময় ১.০ রাখতে হয়), ফলে যেসব সিনারিওতে ইতিমধ্যে কিছু মানদণ্ড ব্যর্থ, তাদের স্কোর সামান্য পরিবর্তিত হতে পারে। এছাড়া, যদি কোনো সিনারিওর "third_party_sharing_disclosed" ফ্ল্যাগ False হয়, সেটি একটি নতুন ব্যর্থতা-উৎস যোগ করবে যা আগে চেকলিস্টে ধরাই পড়েনি।

  2. পরীক্ষা করুন: উপরের কোড সেলে CRITERIA_WEIGHTS-এ "third_party_sharing_disclosed": 0.15 যোগ করুন, বাকি চারটি ওজন সমানুপাতে কমান (যেন যোগফল আবার ১.০ হয়), তিনটি সিনারিওতে এই মানদণ্ডের একটি মান (True/False) দিন, এবং Run চেপে ফলাফল দেখুন।

    সঠিকভাবে বাস্তবায়ন করলে assert লাইনটি পাস হবে (ওজনের যোগফল এখনও ১.০) এবং তিনটি সিনারিওর স্কোর নতুন মানদণ্ডের True/False মান অনুযায়ী পরিবর্তিত হবে — এটি দেখায় কীভাবে একটি চেকলিস্ট-ভিত্তিক অডিট টুল সময়ের সাথে নতুন প্রয়োজনীয়তা যোগ করে বিকশিত হতে পারে।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি, ট্রান্সপারেন্সি, AI অ্যালাইনমেন্ট, জেনারেটিভ AI/LLM এথিক্স, সামাজিক প্রভাব, গভর্নেন্স ও রেগুলেশন, সেক্টর-স্পেসিফিক এথিক্স ও এক্সিস্টেনশিয়াল রিস্ক বিতর্ক — বাকি পাঠগুলো শীঘ্রই যুক্ত হবে।
  • Ethics in Computing & AI Safety কোর্স সহোদর কোর্স সাধারণ কম্পিউটিং এথিক্স, প্রফেশনাল এথিক্স ও সেফটি-ক্রিটিক্যাল কেস স্টাডির একটি বিস্তৃত সার্ভে — এই কোর্স সম্পূর্ণভাবে AI-তে ফোকাস করে গভীরে যায়।
  • সব Courses দেখুন ABCL TECH C, C++, Python, Java, JavaScript, DSA, Machine Learning, Deep Learning, System Design, Cybersecurity, Cloud Computing & DevOps, এবং আরও অনেক কোর্স — সব এক জায়গায়।
আগের পাঠ
AI-তে প্রাইভেসি কেন একটি বিশেষ সমস্যা