ক্যাপাবিলিটি স্কেলিং ও ইমার্জেন্ট বিহেভিয়ার
এই পাঠে যা শিখবেন
- ক্যাপাবিলিটি স্কেলিং ও ইমার্জেন্ট বিহেভিয়ার কী, একটি সাধারণ, সক্রিয়ভাবে-গবেষিত পর্যবেক্ষিত প্যাটার্ন হিসেবে
- মূল্যায়ন মেট্রিকের ধরন কীভাবে "হঠাৎ আবির্ভাব"-এর অনুভূতিকে প্রভাবিত করতে পারে
- কেন এই প্যাটার্ন সেফটি ইভালুয়েশনকে বিশেষভাবে কঠিন করে তোলে
- একটি সত্যিকারের গণনা — স্মুথ বনাম স্টেপ-ফাংশন-সদৃশ ক্যাপাবিলিটি কার্ভ
১ · স্কেল বাড়ার সাথে ক্যাপাবিলিটি কীভাবে বদলায়
একটি বড় ভাষা-মডেল প্রশিক্ষণের সময় সাধারণত তিনটি জিনিস বাড়ানো হয় — প্যারামিটার সংখ্যা, প্রশিক্ষণ ডেটার পরিমাণ, ও ব্যবহৃত কম্পিউট (L27-এ LLM কীভাবে কাজ করে তার সংক্ষিপ্ত রিক্যাপ আছে)। বেশিরভাগ সামগ্রিক পারফরম্যান্স মেট্রিক (যেমন পরবর্তী-টোকেন প্রেডিকশনে গড় লস) স্কেলের সাথে মোটামুটি স্মুথ ও অনুমানযোগ্য প্যাটার্নে উন্নত হয় — এটি ভালোভাবে-নথিভুক্ত একটি পর্যবেক্ষণ। কিন্তু নির্দিষ্ট, পৃথক ডাউনস্ট্রিম টাস্কে (যেমন একটি নির্দিষ্ট ধরনের মাল্টি-স্টেপ যুক্তি সমস্যা) পারফরম্যান্স মাঝেমধ্যে খুব ভিন্নভাবে আচরণ করে — ছোট থেকে মাঝারি স্কেল পর্যন্ত প্রায় কোনো উন্নতি দেখা যায় না, তারপর একটি নির্দিষ্ট স্কেলের কাছে তুলনামূলকভাবে দ্রুত উন্নতি দেখা যায়। AI গবেষণায় এই পর্যবেক্ষিত প্যাটার্নকে সাধারণত ইমার্জেন্ট ক্যাপাবিলিটিইমার্জেন্ট ক্যাপাবিলিটিমডেল/ট্রেনিং স্কেল বাড়ার সাথে একটি নির্দিষ্ট ডাউনস্ট্রিম ক্যাপাবিলিটি স্মুথভাবে না বেড়ে তুলনামূলকভাবে হঠাৎ আবির্ভূত হয় বলে পর্যবেক্ষিত হওয়া। বলা হয়।
২ · কেন এটি সেফটি ইভালুয়েশনকে কঠিন করে
সেফটি টেস্টিং সাধারণত সময় ও খরচ বাঁচাতে ছোট বা মাঝারি স্কেলের মডেলে (বা একটি বড় মডেলের প্রাথমিক চেকপয়েন্টে) শুরু হয়। যদি ক্যাপাবিলিটি সবসময় স্মুথভাবে বাড়ত, তাহলে ছোট স্কেলের ফলাফল থেকে বড় স্কেলের আচরণ মোটামুটি নির্ভরযোগ্যভাবে এক্সট্রাপোলেট (বহির্মুখী অনুমান) করা যেত। কিন্তু যদি কোনো নির্দিষ্ট ক্যাপাবিলিটি (উপকারী বা ক্ষতিকর, দুটোই) হঠাৎ আবির্ভূত হতে পারে, তাহলে ছোট স্কেলে "এই ক্যাপাবিলিটি অনুপস্থিত" পাওয়া গেলেও বড়, ডিপ্লয় করা মডেলে সেই একই ক্যাপাবিলিটি (যেমন একটি ক্ষতিকর ব্যবহারের জন্য প্রয়োজনীয় দক্ষতা) উপস্থিত থাকতে পারে যা আগে থেকে অনুমান করা যায়নি। এ কারণেই দায়িত্বশীল ডিপ্লয়মেন্ট অনুশীলনে ধাপে ধাপে রোলআউট, বড় মডেলের উপর সরাসরি অতিরিক্ত ক্যাপাবিলিটি ইভালুয়েশন (L48-এর রেড-টিমিংয়ের সাথে সংযুক্ত), এবং রক্ষণশীল সীমা নির্ধারণের গুরুত্ব থাকে।
৩ · একটি সত্যিকারের গণনা — কীভাবে মেট্রিক বাছাই "হঠাৎ আবির্ভাব"-এর অনুভূতি তৈরি করতে পারে
নিচের কোড সেলে একটি স্মুথ, লজিস্টিক-আকৃতির আন্ডারলাইং "প্রতি-ধাপ সাফল্যের সম্ভাবনা" সংজ্ঞায়িত করা হয়েছে, যা স্কেলের সাথে ধীরে ধীরে বাড়ে। এরপর দুটি ভিন্ন মূল্যায়ন মেট্রিক প্রতিটি স্কেল পয়েন্টে গণনা করা হয়: (১) সরাসরি আন্ডারলাইং সম্ভাবনা (স্মুথ), এবং (২) একটি "সম্পূর্ণ-নির্ভুল বহু-ধাপ" মেট্রিক (যেমন একটি মাল্টি-স্টেপ যুক্তি সমস্যার প্রতিটি উপ-ধাপ সঠিক হওয়া আবশ্যক) — এই দ্বিতীয় মেট্রিকটি প্রতিটি ধাপের সম্ভাবনার গুণফলের উপর নির্ভর করে বলে ছোট স্কেলে প্রায় সবসময় ব্যর্থ হয়, তারপর তুলনামূলকভাবে দ্রুত বাড়ে — একই স্মুথ আন্ডারলাইং উন্নতি থেকে দুটি ভিন্ন-দেখতে কার্ভ তৈরি হয়।
import math
import random
random.seed(7)
def per_step_success_probability(scale):
# স্মুথ, লজিস্টিক-আকৃতির আন্ডারলাইং সক্ষমতা -- স্কেল বাড়ার সাথে ধীরে ধীরে বাড়ে
x = (scale - 50) / 10
return 1 / (1 + math.exp(-x))
def multi_step_success_rate(scale, steps=4, trials=400):
# "সম্পূর্ণ-নির্ভুল" মেট্রিক: একটি বহু-ধাপ টাস্কের প্রতিটি উপ-ধাপ সঠিক হতে হবে (একটি এক্সাক্ট-ম্যাচ-স্টাইল মেট্রিক)
p = per_step_success_probability(scale)
successes = 0
for _ in range(trials):
all_steps_correct = all(random.random() < p for _ in range(steps))
successes += all_steps_correct
return successes / trials
scales = [10, 20, 30, 40, 50, 60, 70, 80, 90, 100]
print(f"{'স্কেল':>6} | {'স্মুথ মেট্রিক (প্রতি-ধাপ সম্ভাবনা)':<36} | {'স্টেপ-সদৃশ মেট্রিক (৪-ধাপ সম্পূর্ণ-সঠিক হার)'}")
for s in scales:
smooth = per_step_success_probability(s)
stepwise = multi_step_success_rate(s)
smooth_bar = "#" * round(smooth * 30)
step_bar = "#" * round(stepwise * 30)
print(f"{s:>6} | {smooth:.3f} {smooth_bar:<31} | {stepwise:.3f} {step_bar}")
per_step_success_probability() (স্মুথ কলাম) স্কেল ১০ থেকে ১০০ পর্যন্ত
ধারাবাহিকভাবে, ধীরে ধীরে বাড়ে। কিন্তু multi_step_success_rate() (স্টেপ-সদৃশ কলাম) স্কেল
৪০-৫০-এর নিচে প্রায় শূন্যের কাছাকাছি থেকে যায়, তারপর স্কেল ৬০-৮০-এর মধ্যে তুলনামূলকভাবে দ্রুত বেড়ে যায় —
কারণ চারটি স্বাধীন ধাপ সবগুলো সঠিক হওয়ার সম্ভাবনা হলো প্রতি-ধাপ সম্ভাবনার গুণফল ($p^4$), যা ছোট
$p$-এর জন্য দ্রুত ছোট হয়ে যায়। এটি একই আন্ডারলাইং স্মুথ উন্নতি থেকে একটি "হঠাৎ আবির্ভাব"-সদৃশ কার্ভ কীভাবে
তৈরি হতে পারে তার একটি প্রকৃত, গণনাকৃত উদাহরণ — গবেষণায় প্রস্তাবিত একটি সম্ভাব্য অবদানকারী ফ্যাক্টর হিসেবে
(একমাত্র বা সর্বজনস্বীকৃত ব্যাখ্যা হিসেবে নয়)।
ক্যাপাবিলিটি স্কেলিং একটি সক্রিয়ভাবে গবেষিত, বাস্তব পর্যবেক্ষিত প্যাটার্ন — এবং এর ফলে বড় স্কেলের মডেলের নির্দিষ্ট ক্যাপাবিলিটি আগে থেকে সম্পূর্ণ নির্ভুলভাবে অনুমান করা কঠিন। সেফটি-সচেতন অনুশীলনে এর ফল হলো: শুধু ছোট-স্কেল টেস্টিং-এর উপর ভরসা না করা, বরং প্রতিটি নতুন, উল্লেখযোগ্যভাবে বড় মডেলে আলাদাভাবে ক্যাপাবিলিটি ও সেফটি ইভালুয়েশন চালানো এবং রক্ষণশীল, ধাপে-ধাপে ডিপ্লয়মেন্ট অনুশীলন বজায় রাখা।
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১
উপরের কোড সেলে steps প্যারামিটারটি ৪ থেকে বাড়িয়ে ৮ করলে "হঠাৎ আবির্ভাব"-এর প্রভাব
আরও তীব্র হবে নাকি কমে যাবে বলে আপনার ধারণা? কেন?
আরও তীব্র হবে — কারণ আরও বেশি স্বাধীন ধাপ সবগুলো সঠিক হওয়ার সম্ভাবনা ($p^8$) একই $p$-এর জন্য $p^4$-এর চেয়ে আরও দ্রুত ছোট হয়ে যায়। ফলে ছোট/মাঝারি স্কেলে সাফল্যের হার আরও বেশি সময় ধরে প্রায়-শূন্য থাকবে, এবং যখন বাড়া শুরু করবে তখন আরও তীক্ষ্ণভাবে বাড়বে — অর্থাৎ আরও "হঠাৎ" মনে হবে।
প্র ০২ এই পাঠের নোটে বলা হয়েছে "মূল্যায়ন-মেট্রিকের ভূমিকা" একটি সম্ভাব্য অবদানকারী ফ্যাক্টর, একমাত্র ব্যাখ্যা নয়। কেন এই পার্থক্যটি স্পষ্টভাবে বলা গুরুত্বপূর্ণ?
কারণ AI সেফটি গবেষণায় ইমার্জেন্ট ক্যাপাবিলিটির সঠিক কারণ (এটি সম্পূর্ণভাবে মূল্যায়ন-মেট্রিক আর্টিফ্যাক্ট, নাকি আন্ডারলাইং মডেল সক্ষমতাতেও প্রকৃত অ-স্মুথ (discontinuous) পরিবর্তন ঘটে, বা উভয়ের মিশ্রণ) নিয়ে এখনও সক্রিয় গবেষণা ও বিতর্ক চলছে। একটি একক ব্যাখ্যাকে চূড়ান্ত সত্য হিসেবে উপস্থাপন করা এই এখনো-খোলা প্রশ্নটিকে ভুলভাবে বন্ধ করে দেওয়া হবে — এই কোর্সের নীতি (CLAUDE.md) অনুযায়ী বিতর্কিত মেকানিজমকে স্থিরনিশ্চিত সত্য হিসেবে দাবি করা এড়িয়ে চলা উচিত।
প্র ০৩ একটি AI ল্যাব যদি শুধু তাদের পূর্ববর্তী, ছোট মডেলে একটি নির্দিষ্ট ক্ষতিকর ক্যাপাবিলিটি (যেমন উন্নত সাইবার-অ্যাটাক সহায়তা) অনুপস্থিত পেয়ে পরবর্তী, অনেক বড় মডেলটি নিরাপদ বলে ধরে নেয়, এতে কী সমস্যা থাকতে পারে?
এই লেসনের মূল পয়েন্টটাই এখানে প্রযোজ্য: ছোট মডেলে একটি ক্যাপাবিলিটি অনুপস্থিত থাকা বড় মডেলেও তা অনুপস্থিত থাকবে এমন নিশ্চয়তা দেয় না — ইমার্জেন্ট প্যাটার্নের কারণে সেই ক্যাপাবিলিটি বড় মডেলে হঠাৎ উপস্থিত হতে পারে। তাই প্রতিটি উল্লেখযোগ্যভাবে বড় নতুন মডেলে সরাসরি, স্বতন্ত্র সেফটি/ক্যাপাবিলিটি ইভালুয়েশন চালানো জরুরি, শুধু আগের ছোট মডেলের ফলাফল থেকে এক্সট্রাপোলেট করা যথেষ্ট নয়।
অনুশীলন
-
চিন্তা করুন: উপরের কোড সেলে
scalesলিস্টে যদি ১১০, ১২০ যোগ করা হয়, স্মুথ ও স্টেপ-সদৃশ কলাম দুটোর মান কীভাবে বদলাবে বলে আপনার ধারণা?দুটো মানই ১-এর দিকে আরও কাছাকাছি যাবে (লজিস্টিক কার্ভ ১-এ স্যাচুরেট করে), কিন্তু ইতিমধ্যে উচ্চ স্কেলে দুটো মেট্রিকের মধ্যে পার্থক্য কমে আসবে — কারণ যখন প্রতি-ধাপ সম্ভাবনা $p$ ইতিমধ্যে ১-এর কাছাকাছি, তখন $p^4$-ও প্রায় ১-এর কাছাকাছি হয়ে যায়।
-
পরীক্ষা করুন: উপরের কোড সেলে
steps=4-কেsteps=2-এ পরিবর্তন করে Run চেপে দেখুন স্টেপ-সদৃশ কলামের "হঠাৎ আবির্ভাব"-এর প্রভাব কীভাবে কমে যায়।steps=2-এ স্টেপ-সদৃশ মেট্রিক ($p^2$) স্মুথ মেট্রিকের ($p$) অনেক কাছাকাছি আচরণ করবে — পার্থক্য কম দেখাবে, কারণ কম সংখ্যক স্বাধীন ধাপের গুণফল সাফল্যের সম্ভাবনাকে ততটা তীব্রভাবে কমায় না। এটি নিশ্চিত করে যে "হঠাৎ আবির্ভাব"-এর প্রভাব আংশিকভাবে টাস্কের গঠন (কতগুলো উপ-ধাপ সবগুলো সঠিক হতে হয়) থেকেও আসতে পারে।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি, ট্রান্সপারেন্সি, AI অ্যালাইনমেন্ট, জেনারেটিভ AI/LLM এথিক্স, সামাজিক প্রভাব, গভর্নেন্স ও রেগুলেশন, সেক্টর-স্পেসিফিক এথিক্স ও এক্সিস্টেনশিয়াল রিস্ক বিতর্ক — বাকি পাঠগুলো শীঘ্রই যুক্ত হবে।
- Deep Learning কোর্স প্রাসঙ্গিক ফাউন্ডেশন মডেল আর্কিটেকচার, প্রশিক্ষণ ও স্কেলিং-এর কারিগরি দিকগুলো বিস্তারিত কভার করে — এই পাঠ সেই ফাউন্ডেশনের উপর নৈতিক/সেফটি দিকটি যোগ করে।
- সব Courses দেখুন ABCL TECH C, C++, Python, Java, JavaScript, DSA, Machine Learning, Deep Learning, System Design, Cybersecurity, Cloud Computing & DevOps, এবং আরও অনেক কোর্স — সব এক জায়গায়।