পাঠ ৪৩ · ৫৭-এর মধ্যে · মডিউল ১০
Home / Courses / Ethics in Computing & AI Safety / ক্যাপাবিলিটি স্কেলিং ও ইমার্জেন্স

ক্যাপাবিলিটি স্কেলিং ও ইমার্জেন্ট আচরণ

Capability scaling & emergent behavior
৯ মিনিট পড়া উচ্চ · Advanced Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • "ইমার্জেন্ট ক্ষমতা" ধারণাটি একটি পর্যবেক্ষিত প্যাটার্ন হিসেবে কীভাবে সঠিকভাবে বর্ণনা করতে হয়
  • এই প্যাটার্নটি নিয়ে গবেষকদের মধ্যে থাকা প্রকৃত বৈজ্ঞানিক বিতর্ক (সত্যিকারের আকস্মিকতা বনাম মেট্রিক-আর্টিফ্যাক্ট)
  • কেন এই অনিশ্চয়তা AI সেফটি-পরীক্ষার জন্য একটি বাস্তব চ্যালেঞ্জ তৈরি করে
  • Python দিয়ে একটি সিন্থেটিক "সমতল-তারপর-লাফ" আকৃতির টয় মেট্রিক গণনা — গুণগত প্যাটার্নটি সংখ্যায় কংক্রিট করে দেখা

১ · একটি পর্যবেক্ষিত প্যাটার্ন — আইন নয়

M8 (L33-L36) থেকে আমরা জানি একটি মডেল ট্রেনিং ডেটা থেকে পরিসংখ্যানগত প্যাটার্ন শেখে। সাধারণভাবে ধারণা করা হতো যে মডেলের স্কেল (ট্রেনিং ডেটার পরিমাণ, কম্পিউট, প্যারামিটার সংখ্যা) বাড়ালে তার ক্ষমতা মোটামুটি মসৃণ ও ধারাবাহিকভাবে বাড়বে। তবে ML গবেষণা সম্প্রদায়ে ব্যাপকভাবে আলোচিত একটি পর্যবেক্ষণ হলো — কিছু নির্দিষ্ট ক্ষমতা এভাবে মসৃণভাবে না বেড়ে, একটি নির্দিষ্ট স্কেলের আগে প্রায় অনুপস্থিত/দুর্বল থেকে যায়, তারপর সেই থ্রেশহোল্ড পার হওয়ার পর তুলনামূলক দ্রুত উন্নত হতে দেখা যায় — এই প্যাটার্নটিকেই সাধারণত ইমার্জেন্ট ক্ষমতাEmergent Capabilityস্কেল বাড়ার সাথে সাথে কিছু মডেল-ক্ষমতা মসৃণভাবে না বেড়ে একটি থ্রেশহোল্ডের পর তুলনামূলক দ্রুত দেখা দিতে পারে বলে ML গবেষণায় পর্যবেক্ষিত একটি প্যাটার্ন — একটি প্রমাণিত সার্বজনীন সূত্র নয়। বলা হয়।

এই পাঠে ইচ্ছাকৃতভাবে কোনো নির্দিষ্ট বাস্তব বেঞ্চমার্ক সংখ্যা বা মডেলের নাম উল্লেখ করা হয়নি — কারণ এই কোর্স নির্ভুলভাবে নিশ্চিত নয় এমন সুনির্দিষ্ট পরিসংখ্যান বানিয়ে বলবে না। এখানে গুরুত্বপূর্ণ বিষয়টি হলো গুণগত প্যাটার্নটি বোঝা — একটি নির্দিষ্ট সংখ্যা মুখস্থ করা নয়।

২ · গবেষকদের মধ্যে একটি সক্রিয় বিতর্ক

এই প্যাটার্নটিকে একটি "প্রমাণিত সূত্র" হিসেবে না দেখে একটি খোলা গবেষণা-প্রশ্ন হিসেবে দেখাই বেশি সৎ, কারণ এই নিয়ে গবেষকদের মধ্যে বাস্তব মতপার্থক্য আছে।

এক পক্ষের যুক্তি
কিছু গবেষক মনে করেন এটি একটি সত্যিকারের, তুলনামূলক আকস্মিক গুণগত পরিবর্তন — মডেলের অভ্যন্তরীণ আচরণে একটি প্রকৃত "ফেজ ট্রানজিশন"-এর মতো কিছু ঘটে, যা শুধু পরিমাপের কৌশলের কারণে নয়।
অন্য পক্ষের যুক্তি
অন্য গবেষকরা যুক্তি দেন যে আপাত "আকস্মিকতা" আংশিকভাবে বেছে নেওয়া মূল্যায়ন-মেট্রিকের একটি artifact হতে পারে — যেমন একটি "সম্পূর্ণ সঠিক/ভুল" (all-or-nothing) মেট্রিক ব্যবহার করলে, অন্তর্নিহিত পারফরম্যান্স আসলে ধারাবাহিকভাবে বাড়লেও প্রকাশিত ফলাফল হঠাৎ লাফের মতো দেখাতে পারে।

এই কোর্স কোনো একটি পক্ষকে "সঠিক" ঘোষণা করে না — এটি একটি চলমান, বৈধ বৈজ্ঞানিক বিতর্ক, আর এই বিতর্কটির অস্তিত্বই দেখায় যে "ইমার্জেন্স"-কে একটি সরল, অবিসংবাদিত সত্য হিসেবে না দেখে সতর্কতার সাথে দেখা উচিত। AI Foundations ও Generative AI কোর্সের সেফটি পাঠগুলো এই প্যাটার্নটি সংক্ষেপে ছুঁয়ে যায়; Prompt Engineering কোর্সে বড় মডেলের সাথে কাজ করার সময় ব্যবহারিকভাবে এই অপ্রত্যাশিততার মুখোমুখি হওয়ার প্রসঙ্গ সংক্ষেপে আসতে পারে।

৩ · কেন এটি AI সেফটির জন্য গুরুত্বপূর্ণ

যদি কিছু ক্ষমতা সত্যিই স্কেলের সাথে অপ্রত্যাশিতভাবে দেখা দিতে পারে, তাহলে একটি ছোট বা মাঝারি স্কেলের মডেলে করা সেফটি টেস্টিং একটি ভুল আশ্বাস দিতে পারে — একটি বড় স্কেলের ভবিষ্যৎ সংস্করণে হঠাৎ এমন ক্ষমতা (এবং সম্ভাব্য নতুন মিসইউজ বা অ্যাক্সিডেন্ট ঝুঁকি, L42) দেখা দিতে পারে যা ছোট স্কেলে পরীক্ষা করে আগে থেকে সম্পূর্ণভাবে অনুমান করা যায়নি। এটি সেফটি-টেস্টিং প্রক্রিয়ার একটি বাস্তব প্রায়োগিক চ্যালেঞ্জ — "গতবার নিরাপদ ছিল" থেকে "পরের স্কেলেও নিরাপদ থাকবে" এই সিদ্ধান্তে সরাসরি লাফ দেওয়া যায় না।

৪ · একটি সিন্থেটিক টয়-মডেল: "সমতল, তারপর লাফ"

নিচের কোড সেলে "ইমার্জেন্স"-এর গুণগত আকৃতিটি একটি সম্পূর্ণ সিন্থেটিক সূত্র দিয়ে কংক্রিট করে দেখা যাক — এই সংখ্যাগুলো কোনো বাস্তব মডেল বা বেঞ্চমার্কের ফলাফল নয়, শুধু "স্কেল বাড়লে একটি মেট্রিক থ্রেশহোল্ডের আগে প্রায় সমতল থেকে থ্রেশহোল্ডের পরে দ্রুত বাড়তে পারে" — এই আকৃতিটি স্পষ্ট করার একটি টয় উদাহরণ।

Python
import math

# সম্পূর্ণ সিন্থেটিক/ইলাস্ট্রেটিভ টয় মডেল -- কোনো বাস্তব বেঞ্চমার্কের সংখ্যা নয়।
# শুধু এই গুণগত আকৃতি কংক্রিট করে দেখানোর জন্য: স্কেল বাড়ার সাথে সাথে একটি টয় ক্ষমতা-মেট্রিক
# একটি থ্রেশহোল্ডের আগে প্রায় সমতল থাকে, তারপর তুলনামূলক দ্রুত বেড়ে যায়।

def toy_capability_metric(scale, threshold=50, steepness=0.35, baseline=0.12, jump_size=0.75):
    x = -steepness * (scale - threshold)
    jump = jump_size / (1 + math.exp(x))
    wobble = 0.01 * math.sin(scale)  # ছোট, নিয়ন্ত্রিত ওঠানামা -- বাস্তব পরিমাপের শব্দ (noise) অনুকরণ করতে
    return round(baseline + jump + wobble, 3)

scales = [5, 15, 25, 35, 45, 50, 55, 65, 75, 90]

print(f"{'স্কেল (ইলাস্ট্রেটিভ ইউনিট)':<28}টয় মেট্রিক (সিন্থেটিক)")
for s in scales:
    print(f"{s:<28}{toy_capability_metric(s)}")

    
লক্ষ্য করুন স্কেল ৫ থেকে ৩৫ পর্যন্ত মেট্রিকটি প্রায় সমতল থাকে (০.১১-০.১৩-এর কাছাকাছি, শুধু ছোট wobble-এর কারণে সামান্য ওঠানামা করে), তারপর থ্রেশহোল্ড ৫০-এর কাছাকাছি থেকে তুলনামূলক দ্রুত বেড়ে স্কেল ৯০-এ প্রায় ০.৮৮-এ পৌঁছায়। এই আকৃতিটিই — সমতল, তারপর একটি থ্রেশহোল্ডের কাছে তুলনামূলক দ্রুত বৃদ্ধি — গুণগতভাবে "ইমার্জেন্স" বলতে যা বোঝানো হয় তার একটি সরলীকৃত, সম্পূর্ণ সিন্থেটিক চিত্র। প্রকৃত মডেলের প্রকৃত ক্ষমতা এই সরল সূত্র অনুসরণ করে না — এটি শুধু গুণগত আকৃতিটি বোঝার একটি হাতিয়ার।
মূল কথা · Key takeaway

ক্যাপাবিলিটি ইমার্জেন্স একটি বাস্তব, সক্রিয়ভাবে আলোচিত পর্যবেক্ষণ — কিন্তু এটিকে একটি অপরিবর্তনীয় আইন হিসেবে নয়, একটি চলমান গবেষণা-প্রশ্ন হিসেবে দেখা উচিত, যার আকস্মিকতার প্রকৃত মাত্রা নিয়েই গবেষকদের মধ্যে বিতর্ক আছে। ব্যবহারিক প্রভাবটি স্পষ্ট, তবে: ছোট স্কেলে করা সেফটি টেস্টিং বড় স্কেলে নতুন আচরণের সম্পূর্ণ নিশ্চয়তা দিতে পারে না।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ এই পাঠে "ইমার্জেন্ট ক্ষমতা"কে কেন বারবার একটি "পর্যবেক্ষিত প্যাটার্ন" বলা হচ্ছে, একটি "সূত্র" বা "আইন" নয়?

কারণ এটি সততার সাথে বিদ্যমান বৈজ্ঞানিক অবস্থা প্রতিফলিত করে — গবেষকদের মধ্যে এই নিয়ে সক্রিয় বিতর্ক আছে যে এটি সত্যিকারের একটি আকস্মিক ঘটনা নাকি আংশিকভাবে মূল্যায়ন-পদ্ধতির একটি artifact। একটি চলমান গবেষণা-প্রশ্নকে একটি প্রমাণিত সূত্র হিসেবে উপস্থাপন করা বিভ্রান্তিকর হবে।

প্র ০২ ছোট স্কেলের একটি মডেলে সেফটি টেস্টিং "পাস" করা কেন বড় স্কেলের একটি ভবিষ্যৎ সংস্করণের নিরাপত্তার সম্পূর্ণ গ্যারান্টি দেয় না?

কারণ যদি কিছু ক্ষমতা (এবং সেই সাথে সম্ভাব্য নতুন ঝুঁকি) স্কেলের সাথে অপ্রত্যাশিতভাবে দেখা দিতে পারে বলে পর্যবেক্ষিত হয়, তাহলে ছোট স্কেলে যে আচরণ দেখা যায়নি তা বড় স্কেলে হঠাৎ দেখা দিতে পারে — এই সম্ভাবনাটিই ছোট-স্কেল টেস্টিংকে বড়-স্কেল নিরাপত্তার একটি অসম্পূর্ণ প্রক্সি করে তোলে।

প্র ০৩ উপরের কোড সেলের টেবিলে স্কেল ৪৫ (মান ০.২৪) থেকে স্কেল ৫৫ (মান ০.৭৪৯)-এ এত বড় বৃদ্ধি হলো কেন, অথচ স্কেল ৫ থেকে ৩৫ পর্যন্ত প্রায় কিছুই বদলায়নি?

কারণ toy_capability_metric একটি সিগময়েড-আকৃতির (S-shaped) সূত্র ব্যবহার করে, যা threshold=50-এর কাছাকাছি সবচেয়ে দ্রুত বদলায় এবং থ্রেশহোল্ড থেকে দূরে (উভয় দিকে) প্রায় সমতল থাকে। স্কেল ৫-৩৫ থ্রেশহোল্ডের অনেক আগে, তাই jump পদটি প্রায় শূন্যের কাছে থাকে; স্কেল ৪৫-৫৫ ঠিক থ্রেশহোল্ডের চারপাশে, যেখানে এই সূত্রের গাণিতিক গঠন অনুযায়ীই সবচেয়ে দ্রুত পরিবর্তন ঘটে।

অনুশীলন

  1. চিন্তা করুন: যদি একটি নতুন ক্ষমতা সত্যিই স্কেলের সাথে অপ্রত্যাশিতভাবে "ইমার্জ" করতে পারে, তাহলে একটি দায়িত্বশীল AI ল্যাব বড় স্কেলের একটি নতুন মডেল ডিপ্লয় করার আগে কী ধরনের সতর্কতামূলক পদক্ষেপ নিতে পারে?

    উদাহরণ হতে পারে — ধাপে-ধাপে/স্তরে-স্তরে ডিপ্লয়মেন্ট (সীমিত অ্যাক্সেস দিয়ে শুরু করা), বিস্তৃত রেড-টিমিং ও নতুন ক্ষমতার জন্য নির্দিষ্ট পরীক্ষা, এবং ডিপ্লয়মেন্টের পরও চলমান মনিটরিং — যাতে পূর্ব-ডিপ্লয়মেন্ট টেস্টিং কোনো নির্দিষ্ট আচরণ মিস করলেও তা দ্রুত ধরা পড়ে। এটি L44-এ আলোচিত গভর্নেন্স প্রশ্নের সাথেও সরাসরি সম্পর্কিত।

  2. পরীক্ষা করুন: উপরের কোড সেলে threshold=50-কে threshold=70 করে Run চেপে দেখুন — scale=55-এর মান আগের (০.৭৪৯) তুলনায় বাড়ে না কমে?

    কমে যাবে — threshold=70 করলে scale=55 এখন থ্রেশহোল্ডের অনেক আগে পড়ে যায় (আগে থ্রেশহোল্ড ছিল ৫০, তাই ৫৫ থ্রেশহোল্ডের ঠিক পরে ছিল), ফলে jump পদটি প্রায় শূন্যের কাছে চলে যায় এবং মান নেমে প্রায় ০.১১৪-এ (বেসলাইনের কাছাকাছি) দাঁড়ায় — থ্রেশহোল্ড বাড়ানো মানে "লাফ"টি পরের কোনো বড় স্কেলে সরে যাওয়া।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

আগের পাঠ
মিসইউজ রিস্ক বনাম অ্যাক্সিডেন্ট রিস্ক