পাঠ ৩৭ · ৫৭-এর মধ্যে · মডিউল ৯
Home / AI Courses / AI Ethics / GDPR ও ডেটা প্রোটেকশন

GDPR ও AI-তে ডেটা প্রোটেকশন

GDPR & Data Protection in AI
৯ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • GDPR কী, কবে থেকে কার্যকর, এবং এর সাতটি মূলনীতি
  • ডেটা সাবজেক্টের অধিকারসমূহ — বিশেষ করে অটোমেটেড সিদ্ধান্ত সংক্রান্ত অধিকার
  • AI ডেটা পাইপলাইনের কোন ধাপে কোন GDPR নীতি প্রযোজ্য হয়
  • একটি সত্যিকারের, চলমান GDPR-কমপ্লায়েন্স চেকলিস্ট স্কোরার — একটি কাল্পনিক AI ডেটা পাইপলাইনে প্রয়োগ করে

১ · GDPR কী এবং এর মূলনীতিসমূহ

GDPRGDPRGeneral Data Protection Regulation — ইউরোপীয় ইউনিয়নের ডেটা-প্রোটেকশন ও প্রাইভেসি রেগুলেশন, মে ২০১৮ থেকে কার্যকর। হলো ইউরোপীয় ইউনিয়নের একটি ব্যাপক ডেটা-প্রোটেকশন রেগুলেশন, যা মে ২০১৮ থেকে কার্যকর হয়েছে। এটি শুধু EU-ভিত্তিক প্রতিষ্ঠানের জন্য নয় — EU নাগরিকদের ডেটা প্রসেস করে এমন যেকোনো প্রতিষ্ঠানের জন্য প্রযোজ্য, তাই বিশ্বব্যাপী AI ডেভেলপমেন্ট প্র্যাকটিসের উপর এর প্রভাব ব্যাপক। GDPR-এর মূলে আছে সাতটি core principle:

Lawfulness, Fairness & Transparency
ডেটা প্রসেসিংয়ের একটি বৈধ আইনি ভিত্তি থাকতে হবে এবং তা ন্যায্য ও স্বচ্ছভাবে করতে হবে।
Purpose Limitation
ডেটা শুধু নির্দিষ্ট, স্পষ্ট বলা উদ্দেশ্যে সংগ্রহ করা যাবে — এবং সেই উদ্দেশ্যের সাথে অসামঞ্জস্যপূর্ণ অন্য কাজে পুনরায় ব্যবহার করা যাবে না।
Data Minimization
উদ্দেশ্য পূরণের জন্য যতটুকু প্রয়োজন, ঠিক ততটুকুই ডেটা সংগ্রহ করতে হবে — বেশি নয়।
Accuracy
ডেটা সঠিক রাখতে হবে এবং প্রয়োজনে আপ-টু-ডেট করতে হবে।
Storage Limitation
উদ্দেশ্য পূরণের প্রয়োজনীয় সময়ের বেশি ডেটা রাখা যাবে না।
Integrity & Confidentiality
উপযুক্ত সিকিউরিটি ব্যবস্থা দিয়ে ডেটা অননুমোদিত অ্যাক্সেস/ক্ষতি থেকে সুরক্ষিত রাখতে হবে।
Accountability
প্রতিষ্ঠানকে প্রমাণ করতে হবে যে তারা এই নীতিগুলো মেনে চলছে — শুধু মেনে চলাই যথেষ্ট নয়, তা ডকুমেন্ট করতে হবে।

২ · ডেটা সাবজেক্টের অধিকার

GDPR ব্যক্তিদের (ডেটা সাবজেক্ট) বেশ কয়েকটি নির্দিষ্ট অধিকার দেয়: অ্যাক্সেসের অধিকার (নিজের সম্পর্কে কী ডেটা রাখা হয়েছে তা জানার অধিকার), রেক্টিফিকেশনের অধিকার (ভুল ডেটা সংশোধনের অনুরোধ), ইরেজারের অধিকার ("right to be forgotten" — নির্দিষ্ট পরিস্থিতিতে ডেটা মুছে ফেলার অনুরোধ), ডেটা পোর্টেবিলিটির অধিকার (নিজের ডেটা একটি ব্যবহারযোগ্য ফরম্যাটে অন্য সেবায় স্থানান্তর করার অধিকার), এবং AI-এর প্রেক্ষাপটে সবচেয়ে গুরুত্বপূর্ণ — সম্পূর্ণ অটোমেটেড সিদ্ধান্তে আপত্তি জানানোর অধিকার, যার সাথে যুক্ত আছে সেই সিদ্ধান্তের যুক্তি সম্পর্কে অর্থবহ তথ্য পাওয়ার অধিকার।

AI-নির্দিষ্ট প্রভাব ১ — "Right to Explanation"

একটি সম্পূর্ণ অটোমেটেড সিদ্ধান্ত (যেমন একটি AI মডেল একাই লোন অনুমোদন/প্রত্যাখ্যান করে দিচ্ছে, কোনো মানুষের রিভিউ ছাড়াই) কারো উপর উল্লেখযোগ্য প্রভাব ফেললে, সংশ্লিষ্ট ব্যক্তির অধিকার আছে সেই সিদ্ধান্তে জড়িত যুক্তি সম্পর্কে অর্থবহ তথ্য পাওয়ার। এটি একটি সত্যিকারের ব্ল্যাক-বক্স ডিপ লার্নিং মডেলের জন্য বাস্তব চ্যালেঞ্জ তৈরি করে — "মডেলটি জটিল, তাই ব্যাখ্যা করা যায় না" এটি একটি গ্রহণযোগ্য উত্তর নয় (M5-এ এক্সপ্লেইনেবিলিটি টেকনিক বিস্তারিত কভার করা হয়েছে)।

ডেটা সংগ্রহ Data Collection মডেল ট্রেনিং Model Training অটোমেটেড সিদ্ধান্ত Automated Decision পারপাস লিমিটেশন + ডেটা মিনিমাইজেশন অ্যাকাউন্টেবিলিটি + অ্যাকুরেসি রাইট টু এক্সপ্লেনেশন
AI ডেটা পাইপলাইনের প্রতিটি ধাপে ভিন্ন GDPR নীতি সবচেয়ে বেশি প্রাসঙ্গিক হয়ে ওঠে — সংগ্রহে পারপাস লিমিটেশন ও মিনিমাইজেশন, ট্রেনিংয়ে অ্যাকাউন্টেবিলিটি, আর অটোমেটেড সিদ্ধান্তে ব্যাখ্যার অধিকার।

৩ · AI-নির্দিষ্ট প্রভাব ২ — ডেটা মিনিমাইজেশন বনাম "বেশি ডেটা = ভালো মডেল"

মেশিন লার্নিং-এর একটি সাধারণ স্বজ্ঞা হলো, "যত বেশি ট্রেনিং ডেটা, মডেল তত ভালো" (../machine-learning/-এ এই সাধারণ প্যাটার্নটি বিস্তারিত আলোচিত)। কিন্তু ডেটা মিনিমাইজেশন নীতি অনুযায়ী, "এটি ভবিষ্যতে কোনো না কোনোভাবে কাজে লাগতে পারে" — এই যুক্তি একা ডেটা সংগ্রহের justification হিসেবে যথেষ্ট নয়। প্রতিটি সংগৃহীত ফিচারের জন্য একটি নির্দিষ্ট, বলা উদ্দেশ্য থাকতে হবে। এর ব্যবহারিক ফলাফল: একটি টিমকে সিদ্ধান্ত নিতে হয় কোন ফিচারগুলো সত্যিই মডেলের জন্য প্রয়োজনীয়, এবং কোনগুলো শুধু "থাকলে ভালো হতো" — এটি প্রায়ই মডেল পারফরম্যান্স ও কমপ্লায়েন্সের মধ্যে একটি বাস্তব ট্রেড-অফ তৈরি করে।

নিচের কোড সেলে একটি কাল্পনিক AI ডেটা পাইপলাইনের জন্য একটি সত্যিকারের, ওজন-ভিত্তিক (weighted) GDPR-কমপ্লায়েন্স চেকলিস্ট স্কোরার তৈরি করা হয়েছে — প্রতিটি নীতির একটি ওজন আছে (সবগুলোর সমষ্টি ১.০), এবং প্রতিটি চেকলিস্ট আইটেম উপস্থিত/অনুপস্থিত কি না তার উপর ভিত্তি করে একটি সামগ্রিক স্কোর প্রকৃতপক্ষে গণনা করা হয়।

Python
gdpr_checklist = {
    "lawful_basis_documented": {
        "present": True, "weight": 0.15,
        "label": "প্রসেসিংয়ের আইনি ভিত্তি ডকুমেন্টেড (lawfulness)"},
    "purpose_limitation_respected": {
        "present": True, "weight": 0.15,
        "label": "শুধু নির্ধারিত উদ্দেশ্যে ডেটা ব্যবহার (purpose limitation)"},
    "data_minimization_applied": {
        "present": False, "weight": 0.15,
        "label": "শুধু প্রয়োজনীয় ফিচার সংগ্রহ (data minimization)"},
    "accuracy_maintained": {
        "present": True, "weight": 0.10,
        "label": "ডেটা সঠিক ও আপ-টু-ডেট রাখার প্রক্রিয়া (accuracy)"},
    "storage_limitation_enforced": {
        "present": False, "weight": 0.10,
        "label": "নির্দিষ্ট সময় পর ডেটা মুছে ফেলার নীতি (storage limitation)"},
    "security_measures_in_place": {
        "present": True, "weight": 0.10,
        "label": "টেকনিক্যাল/অর্গানাইজেশনাল সিকিউরিটি ব্যবস্থা (integrity & confidentiality)"},
    "accountability_documentation": {
        "present": True, "weight": 0.10,
        "label": "প্রসেসিং কার্যক্রমের রেকর্ড রক্ষণ (accountability)"},
    "automated_decision_disclosure": {
        "present": False, "weight": 0.10,
        "label": "অটোমেটেড সিদ্ধান্তের যুক্তি সম্পর্কে অর্থবহ তথ্য প্রদান (right to explanation)"},
    "data_subject_rights_supported": {
        "present": True, "weight": 0.05,
        "label": "অ্যাক্সেস/রেক্টিফিকেশন/ইরেজার রিকোয়েস্ট হ্যান্ডল করার প্রক্রিয়া"},
}

total_weight = sum(item["weight"] for item in gdpr_checklist.values())
assert abs(total_weight - 1.0) < 1e-9, "ওজনের সমষ্টি অবশ্যই ১.০ হতে হবে"

score = sum(item["weight"] for item in gdpr_checklist.values() if item["present"])
strong = [item["label"] for item in gdpr_checklist.values() if item["present"]]
weak = [item["label"] for item in gdpr_checklist.values() if not item["present"]]

print(f"GDPR কমপ্লায়েন্স স্কোর: {score * 100:.1f} / 100\n")

print(f"পূরণ হয়েছে এমন আইটেম ({len(strong)}টি):")
for label in strong:
    print(f"  [OK] {label}")

print(f"\nদুর্বল/অনুপস্থিত ক্ষেত্র ({len(weak)}টি):")
for label in weak:
    print(f"  [MISSING] {label}")

    
লক্ষ্য করুন — স্কোরটি (৬৫.০/১০০) কোথাও হার্ডকোড করা হয়নি; এটি প্রতিটি আইটেমের weight ও present মান থেকে সরাসরি গণনা করা হয়েছে। এই কাল্পনিক পাইপলাইনটি ডেটা মিনিমাইজেশন, স্টোরেজ লিমিটেশন, এবং অটোমেটেড-সিদ্ধান্ত ডিসক্লোজার — এই তিনটি ক্ষেত্রে দুর্বল, যা মোট ওজনের ৩৫% বহন করে। একটি বাস্তব কমপ্লায়েন্স অডিটে ঠিক এভাবেই দুর্বল ক্ষেত্রগুলো চিহ্নিত করে অগ্রাধিকার ঠিক করা হয়।

৪ · জরিমানা ও প্রয়োগ

GDPR লঙ্ঘনের জন্য জরিমানা €২০ মিলিয়ন অথবা প্রতিষ্ঠানের বৈশ্বিক বার্ষিক টার্নওভারের ৪%, যেটি বেশি, সেই পরিমাণ পর্যন্ত পৌঁছাতে পারে। এই লেসনে কোনো নির্দিষ্ট প্রতিষ্ঠানের নাম করে কোনো নির্দিষ্ট জরিমানার পরিমাণ বা মামলার রায় উল্লেখ করা হচ্ছে না — সংখ্যাটি রেগুলেশনের সর্বোচ্চ সীমা হিসেবে উল্লেখ করা হলো, কোনো নির্দিষ্ট ঘটনার ফলাফল হিসেবে নয়।

মূল কথা · Key takeaway

GDPR একটি সাধারণ প্রাইভেসি রেগুলেশন হলেও AI-এর জন্য এর প্রভাব বিশেষভাবে ধারালো — কারণ AI মডেল স্বভাবগতভাবেই বেশি ডেটা চায় (মিনিমাইজেশনের সাথে টেনশন) এবং প্রায়ই এমনভাবে সিদ্ধান্ত নেয় যা ব্যাখ্যা করা কঠিন (রাইট টু এক্সপ্লেনেশনের সাথে টেনশন)। এই দুটো টেনশন — ডেটা ও ব্যাখ্যাযোগ্যতা — এই কোর্সের M4 (প্রাইভেসি) ও M5 (ট্রান্সপারেন্সি) মডিউলের সাথে সরাসরি যুক্ত।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ একটি কোম্পানি বলছে, "আমাদের মডেল খুবই জটিল ডিপ লার্নিং নেটওয়ার্ক, তাই আমরা ব্যবহারকারীকে ঠিক কীভাবে সিদ্ধান্ত নেওয়া হলো তা বলতে পারি না।" GDPR-এর আলোকে এই উত্তরে কী সমস্যা আছে?

GDPR ডেটা সাবজেক্টকে অটোমেটেড সিদ্ধান্তের যুক্তি সম্পর্কে অর্থবহ তথ্য পাওয়ার অধিকার দেয় — "মডেল জটিল" এটি একটি টেকনিক্যাল বাস্তবতা হতে পারে, কিন্তু এটি বাধ্যবাধকতা থেকে মুক্তির অজুহাত নয়। এর ব্যবহারিক অর্থ, প্রতিষ্ঠানকে হয় এক্সপ্লেইনেবিলিটি টেকনিক (M5) ব্যবহার করে একটি বোধগম্য ব্যাখ্যা তৈরি করতে হবে, নয়তো এমন মডেল বেছে নিতে হবে যা প্রকৃতিগতভাবে বেশি ব্যাখ্যাযোগ্য।

প্র ০২ একটি কাস্টমার সাপোর্ট চ্যাট লগ মূলত গ্রাহক-সেবার উদ্দেশ্যে সংগ্রহ করা হয়েছিল। পরে কোম্পানিটি সেই লগগুলো একটি নতুন AI চ্যাটবট ট্রেনিং করতে ব্যবহার করতে চায়। GDPR-এর কোন নীতি এখানে সরাসরি প্রাসঙ্গিক, এবং কেন?

পারপাস লিমিটেশন নীতি সরাসরি প্রাসঙ্গিক — ডেটা যে নির্দিষ্ট উদ্দেশ্যে সংগ্রহ করা হয়েছিল (গ্রাহক সমস্যা সমাধান), তার সাথে অসামঞ্জস্যপূর্ণ একটি নতুন উদ্দেশ্যে (মডেল ট্রেনিং) ব্যবহার করার আগে সাধারণত নতুন আইনি ভিত্তি বা সম্মতি প্রয়োজন হতে পারে। শুধু "ডেটা তো আমাদের কাছেই আছে" যথেষ্ট নয়।

প্র ০৩ উপরের কোড সেলে data_minimization_applied ও automated_decision_disclosure দুটোই False। কোনটি ঠিক করা কোম্পানির জন্য অগ্রাধিকার হওয়া উচিত বলে আপনার মনে হয়, এবং কেন শুধু স্কোরের সংখ্যা দেখে সিদ্ধান্ত নেওয়া যথেষ্ট নয়?

দুটোরই ওজন সমান (০.১০ করে), তাই স্কোরের উপর সমান প্রভাব — কিন্তু বাস্তব-জগতের ঝুঁকি ভিন্ন হতে পারে: যদি মডেলটি সরাসরি ব্যক্তিদের উল্লেখযোগ্যভাবে প্রভাবিত করে এমন সিদ্ধান্ত নেয় (যেমন লোন প্রত্যাখ্যান), তাহলে অটোমেটেড-ডিসিশন ডিসক্লোজার আইনি ও নৈতিকভাবে বেশি জরুরি হতে পারে। এটি দেখায় — একটি একক ওজন-ভিত্তিক স্কোর দরকারি সারাংশ দেয়, কিন্তু প্রেক্ষাপট-নির্ভর ঝুঁকি বিবেচনা করে মানবিক বিচারবুদ্ধি প্রতিস্থাপন করে না।

অনুশীলন

  1. চিন্তা করুন: উপরের কোড সেলে যদি কোম্পানিটি data_minimization_applied-কে True-তে পরিবর্তন করে (অর্থাৎ সেই সমস্যা ঠিক করে), নতুন স্কোরটি কত হবে বলে আপনি হিসাব করতে পারেন?

    বর্তমান স্কোর ৬৫.০। data_minimization_applied-এর ওজন ০.১৫ (অর্থাৎ ১৫ পয়েন্ট), তাই এটি True করলে নতুন স্কোর হবে ৬৫.০ + ১৫.০ = ৮০.০/১০০।

  2. পরীক্ষা করুন: উপরের কোড সেলে data_minimization_applied-এর "present" মান True-তে পরিবর্তন করে Run চেপে আপনার হিসাব যাচাই করুন।

    রান করলে দেখা যাবে স্কোর সত্যিই ৮০.০/১০০ হয়ে গেছে, এবং "দুর্বল/অনুপস্থিত ক্ষেত্র" তালিকা থেকে সেই আইটেমটি সরে গিয়ে "পূরণ হয়েছে" তালিকায় যুক্ত হয়েছে — স্কোরটি সত্যিই ডেটা থেকে গণনা হচ্ছে, কোনো স্ট্যাটিক টেক্সট নয়।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • পরবর্তী পাঠ — EU AI Act L38 GDPR ডেটা প্রসেসিংকে নিয়ন্ত্রণ করে, আর EU AI Act পুরো AI সিস্টেমকে রিস্ক-লেভেল অনুযায়ী নিয়ন্ত্রণ করে — এই দুটো একসাথে ইউরোপের AI রেগুলেটরি ল্যান্ডস্কেপ তৈরি করে।
  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি, ট্রান্সপারেন্সি, AI অ্যালাইনমেন্ট, জেনারেটিভ AI/LLM এথিক্স, সামাজিক প্রভাব, গভর্নেন্স ও রেগুলেশন, সেক্টর-স্পেসিফিক এথিক্স ও এক্সিস্টেনশিয়াল রিস্ক বিতর্ক।
  • Ethics in Computing & AI Safety কোর্স সহোদর কোর্স সাধারণ কম্পিউটিং এথিক্স, প্রফেশনাল এথিক্স ও সেফটি-ক্রিটিক্যাল কেস স্টাডির একটি বিস্তৃত সার্ভে।
আগের পাঠ
AI ও ডিজিটাল ডিভাইড — অ্যাক্সেস বৈষম্য