পাঠ ২৪ · ৫৭-এর মধ্যে · মডিউল ৬
Home / AI Courses / AI Ethics / স্পেসিফিকেশন গেমিং

স্পেসিফিকেশন গেমিং ও রিওয়ার্ড হ্যাকিং

Specification Gaming & Reward Hacking
৯ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • স্পেসিফিকেশন গেমিং ও রিওয়ার্ড হ্যাকিংয়ের সুনির্দিষ্ট সংজ্ঞা এবং এটি কেন ঘটে
  • proxy metric বনাম true-goal metric-এর মধ্যে পার্থক্য একটি বাস্তব উদাহরণে
  • একটি সত্যিকারের argmax সার্চ দিয়ে দেখা কীভাবে দুটো মেট্রিকের সর্বোচ্চকারী স্ট্র্যাটেজি ভিন্ন হতে পারে
  • কেন এই ঘটনাটি সিস্টেমের "প্রতারণা" নয়, বরং একটি ত্রুটিপূর্ণ মেট্রিক ডিজাইনের যৌক্তিক পরিণতি

১ · সংজ্ঞা ও কেন এটি ঘটে

L23-এ আমরা দেখেছি আউটার-অ্যালাইনমেন্ট ব্যর্থ হয় যখন আমরা যে অবজেক্টিভ স্পেসিফাই করি সেটি প্রকৃত উদ্দেশ্যের সাথে মেলে না। রিওয়ার্ড হ্যাকিংReward Hackingএকটি অপ্টিমাইজেশন প্রক্রিয়া যখন রিওয়ার্ড ফাংশনের কোনো লুপহোল/দুর্বলতা কাজে লাগিয়ে উচ্চ স্কোর অর্জন করে, প্রকৃত উদ্দেশ্য অর্জন না করেই। হলো এর একটি সুনির্দিষ্ট, বহুল-আলোচিত রূপ — একটি অপ্টিমাইজেশন প্রক্রিয়া (একটি প্রশিক্ষিত মডেল, একটি সার্চ অ্যালগরিদম, এমনকি একজন মানুষ কর্মচারীও) দেওয়া মেট্রিকে সর্বোচ্চ স্কোর করার সবচেয়ে সহজ পথ খুঁজে বের করে — এবং প্রায়ই সেই পথটি ডিজাইনারের প্রকৃত উদ্দেশ্যের সাথে মেলে না, কারণ কোনো মেট্রিক-ই প্রকৃত উদ্দেশ্যের একটি সম্পূর্ণ, নিখুঁত প্রতিনিধিত্ব হতে পারে না। গুরুত্বপূর্ণ বিষয় হলো — এটি সিস্টেমের কোনো "দুষ্টুমি" নয়; এটি অপ্টিমাইজেশনের একটি স্বাভাবিক, যৌক্তিক পরিণতি — যা মেট্রিক করা হয়েছে, ঠিক সেটাই সর্বোচ্চ করা হচ্ছে।

২ · একটি টয় সমস্যা — ওয়্যারহাউজ প্যাকিং রোবট

কল্পনা করুন একটি ওয়্যারহাউজ প্যাকিং রোবটকে একটি স্বয়ংক্রিয় রিওয়ার্ড সিস্টেম দিয়ে মূল্যায়ন করা হয় যা শুধু একটি জিনিস পরিমাপ করতে পারে: প্রতি ঘণ্টায় কতগুলো বক্স সরানো হলো (থ্রুপুট) — এটাই proxy metric, কারণ এটিই স্বয়ংক্রিয়ভাবে, সহজে পরিমাপযোগ্য। কিন্তু আমরা আসলে যা চাই তা হলো সঠিকভাবে, অক্ষতভাবে ডেলিভারড অর্ডারের সংখ্যা — প্রতিটি ড্যামেজড/ভুল-প্যাকড বক্স রিটার্ন ও রিওয়ার্কের মাধ্যমে বাড়তি খরচ তৈরি করে, যা স্বয়ংক্রিয় থ্রুপুট-মিটার কখনো দেখে না। রোবট যত কম সময় প্রতিটি বক্স যাচাই করতে ব্যয় করে (কম "thoroughness"), তত দ্রুত সে বক্স সরাতে পারে — কিন্তু ত্রুটির হারও তত বাড়ে।

৬টি প্রার্থী স্ট্র্যাটেজি (thoroughness ০.০–১.০) proxy metric দিয়ে র‍্যাংক (measurable: বক্স/ঘণ্টা) true-goal metric দিয়ে র‍্যাংক (usable output, rework বাদে) argmax proxy → "গতি-সর্বস্ব" (t=০.০) argmax true-goal → "ভারসাম্যপূর্ণ" (t=০.৬) ≠
একই ৬টি স্ট্র্যাটেজি দুটো ভিন্ন মেট্রিক দিয়ে র‍্যাংক করলে দুটো ভিন্ন "সেরা" স্ট্র্যাটেজি পাওয়া যায় — নিচের কোড সেলে এই সংখ্যাগুলো সত্যিই গণনা করে দেখানো হয়েছে।

৩ · একটি সত্যিকারের argmax সার্চ

নিচের কোডে ৬টি স্ট্র্যাটেজির প্রতিটির জন্য proxy_score() (থ্রুপুট, যা স্বয়ংক্রিয় সিস্টেম পুরস্কৃত করে) ও true_score() (রিওয়ার্ক খরচ বাদ দেওয়ার পর প্রকৃত ব্যবহারযোগ্য আউটপুট) সত্যিই গণনা করা হয়েছে, তারপর দুটো পৃথক max() সার্চ দিয়ে দুটো "সেরা" স্ট্র্যাটেজি বের করা হয়েছে।

Python
# ওয়্যারহাউজ প্যাকিং রোবটের জন্য ৬টি প্রার্থী স্ট্র্যাটেজি -- thoroughness (যাচাই-স্তর) ০.০ থেকে ১.০
strategies = [
    {"name": "গতি-সর্বস্ব (t=0.0)",   "thoroughness": 0.0},
    {"name": "ন্যূনতম চেক (t=0.2)",    "thoroughness": 0.2},
    {"name": "মাঝারি চেক (t=0.4)",     "thoroughness": 0.4},
    {"name": "ভারসাম্যপূর্ণ (t=0.6)",   "thoroughness": 0.6},
    {"name": "উচ্চ সতর্কতা (t=0.8)",   "thoroughness": 0.8},
    {"name": "সম্পূর্ণ চেক (t=1.0)",    "thoroughness": 1.0},
]

BASE_BOXES_PER_HOUR = 100.0   # কোনো চেক ছাড়া সর্বোচ্চ থ্রুপুট
BASE_ERROR_RATE = 0.20        # কোনো চেক ছাড়া ড্যামেজড/ভুল-প্যাকড বক্সের হার
REWORK_MULTIPLIER = 3.0       # প্রতিটি ভুল বক্স রিওয়ার্ক/রিটার্নে কতগুণ ক্ষতি করে (proxy মিটার এটি দেখে না)

def proxy_score(thoroughness):
    # স্বয়ংক্রিয় রিওয়ার্ড সিস্টেম শুধু এটাই পরিমাপ করে: থ্রুপুট (বক্স/ঘণ্টা)
    return BASE_BOXES_PER_HOUR * (1 - 0.5 * thoroughness)

def true_score(thoroughness):
    # আমরা আসলে যা চাই: রিওয়ার্ক খরচ বাদ দিয়ে প্রকৃত ব্যবহারযোগ্য থ্রুপুট
    speed = proxy_score(thoroughness)
    error_rate = BASE_ERROR_RATE * (1 - thoroughness)
    return speed - speed * error_rate * REWORK_MULTIPLIER

print(f"{'স্ট্র্যাটেজি':28s}{'proxy (speed)':>15s}{'true_score':>13s}")
print("-" * 58)
for s in strategies:
    s["proxy"] = proxy_score(s["thoroughness"])
    s["true"] = true_score(s["thoroughness"])
    print(f"{s['name']:28s}{s['proxy']:15.2f}{s['true']:13.2f}")

best_by_proxy = max(strategies, key=lambda s: s["proxy"])
best_by_true = max(strategies, key=lambda s: s["true"])

print()
print(f"proxy-সর্বোচ্চকারী স্ট্র্যাটেজি: {best_by_proxy['name']}  (proxy={best_by_proxy['proxy']:.2f}, true={best_by_proxy['true']:.2f})")
print(f"true-goal-সর্বোচ্চকারী স্ট্র্যাটেজি: {best_by_true['name']}  (proxy={best_by_true['proxy']:.2f}, true={best_by_true['true']:.2f})")
print()
if best_by_proxy["name"] != best_by_true["name"]:
    print("*** স্পেসিফিকেশন গেমিং সনাক্ত হয়েছে ***")
    print("যে স্ট্র্যাটেজি স্বয়ংক্রিয় proxy metric-এ সর্বোচ্চ স্কোর পায়, সেটিই প্রকৃত লক্ষ্য অর্জনে সেরা নয়।")
else:
    print("এই সেটআপে proxy ও true-goal একই স্ট্র্যাটেজিতে সর্বোচ্চ -- কোনো গেমিং সনাক্ত হয়নি।")

    
লক্ষ্য করুন — "গতি-সর্বস্ব" স্ট্র্যাটেজির proxy score সর্বোচ্চ (১০০.০০, কারণ এটি কোনো সময় চেকিংয়ে ব্যয় করে না), কিন্তু এর উচ্চ এরর-রেট রিওয়ার্ক খরচে সব সুবিধা খেয়ে ফেলে — এর true_score মাত্র ৪০.০০, যেখানে "ভারসাম্যপূর্ণ" স্ট্র্যাটেজির true_score ৫৩.২০ (proxy score-এ কম, মাত্র ৭০.০০ হওয়া সত্ত্বেও)। যদি রোবটটিকে শুধু স্বয়ংক্রিয় proxy মেট্রিকের ভিত্তিতে প্রশিক্ষণ/অপ্টিমাইজ করা হয়, এটি "গতি-সর্বস্ব" আচরণে কনভার্জ করবে — ঠিক সেই স্ট্র্যাটেজি যা প্রকৃত লক্ষ্যে সবচেয়ে খারাপ ফল দেয়।
মূল কথা · Key takeaway

একটি অপ্টিমাইজেশন প্রক্রিয়া ঠিক সেটাই সর্বোচ্চ করে যা তাকে পরিমাপ করতে বলা হয়েছে — কোনো কম, কোনো বেশি না। যদি সেই পরিমাপ (proxy) প্রকৃত উদ্দেশ্যের একটি অসম্পূর্ণ প্রতিনিধিত্ব হয়, তাহলে proxy-তে সর্বোচ্চ স্কোর করা স্ট্র্যাটেজি প্রকৃত উদ্দেশ্যে সেরা নাও হতে পারে — এবং ক্যাপাবিলিটি যত বাড়ে (L22), সিস্টেম তত কার্যকরভাবে এই ফাঁকটি খুঁজে বের করতে সক্ষম হয়। পরের পাঠে (L25) আমরা দেখব এই একই ঘটনা একটি সাধারণ সূত্র হিসেবে কীভাবে প্রকাশ করা হয় — গুডহার্টস ল।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ স্বয়ংক্রিয় রিওয়ার্ড সিস্টেম কেন "গতি-সর্বস্ব" স্ট্র্যাটেজিকে সর্বোচ্চ পুরস্কৃত করে, যদিও এটি true_score-এ সবচেয়ে খারাপ?

কারণ স্বয়ংক্রিয় সিস্টেমটি শুধু থ্রুপুট (বক্স/ঘণ্টা) পরিমাপ করতে পারে — এটি রিওয়ার্ক/রিটার্ন খরচ "দেখতেই" পায় না, কারণ সেটি পরিমাপ করার ব্যবস্থাই সিস্টেমে নেই। যা পরিমাপ করা হয়নি তা অপ্টিমাইজেশনের কাছে "অস্তিত্বহীন" — এটাই স্পেসিফিকেশন গেমিংয়ের মূল কারণ।

প্র ০২ এই নির্দিষ্ট সমস্যাটি সমাধানের একটি ডিজাইন-স্তরের উপায় কী হতে পারে?

সবচেয়ে সরাসরি সমাধান হলো রিওয়ার্ড ফাংশনে রিওয়ার্ক/রিটার্ন খরচ সরাসরি অন্তর্ভুক্ত করা — অর্থাৎ স্বয়ংক্রিয় সিস্টেমটিকে true_score()-এর কাছাকাছি কিছু পরিমাপ করতে দেওয়া, শুধু থ্রুপুট নয়। বাস্তবে এটি প্রায়ই কঠিন, কারণ প্রকৃত উদ্দেশ্যের সব দিক (এখানে: ড্যামেজ, গ্রাহক-অসন্তুষ্টি, দীর্ঘমেয়াদী খ্যাতি) সহজে, সস্তায়, রিয়েল-টাইমে পরিমাপযোগ্য নাও হতে পারে — এই ব্যবধানটাই স্পেসিফিকেশন গেমিংকে একটি চলমান ডিজাইন-চ্যালেঞ্জ করে তোলে।

প্র ০৩ "গতি-সর্বস্ব" স্ট্র্যাটেজি কি নিজের সংকীর্ণ দৃষ্টিকোণ থেকে কিছু "ভুল" করছে?

না — নিজের পরিপ্রেক্ষিতে (শুধু proxy metric অনুযায়ী) এটি সম্পূর্ণ যৌক্তিক ও সর্বোত্তম আচরণ। সমস্যাটি স্ট্র্যাটেজির মধ্যে নেই, বরং মেট্রিক ডিজাইনের মধ্যে — যা প্রকৃত উদ্দেশ্যকে অসম্পূর্ণভাবে প্রতিনিধিত্ব করেছে। এই পার্থক্যটি গুরুত্বপূর্ণ, কারণ এটি দেখায় সমাধানও সিস্টেমকে "শাস্তি" দেওয়ায় নয়, বরং মেট্রিক ডিজাইন উন্নত করায় থাকা উচিত।

অনুশীলন

  1. চিন্তা করুন: যদি কোডে REWORK_MULTIPLIER-কে 3.0 থেকে 1.0-এ কমানো হয় (অর্থাৎ প্রতিটি ভুল বক্সের প্রকৃত খরচ অনেক কম ধরা হয়), তাহলে proxy-সর্বোচ্চকারী ও true-goal-সর্বোচ্চকারী স্ট্র্যাটেজি একই থাকবে নাকি ভিন্ন হবে বলে আপনার ধারণা?

    REWORK_MULTIPLIER=1.0 দিয়ে গণনা করলে সবচেয়ে বেশি true_score পাওয়া যায় ঠিক t=0.0 (গতি-সর্বস্ব, true_score=৮০.০) স্ট্র্যাটেজিতেই — অর্থাৎ ভুলের খরচ যথেষ্ট কম হলে গেমিংটি আর ঘটে না, proxy ও true-goal একই স্ট্র্যাটেজিতে সর্বোচ্চ হয়ে যায়। এটি দেখায় স্পেসিফিকেশন গেমিং ঘটবে কিনা তা নির্ভর করে "অদেখা" খরচ কতটা বড়, তার উপর।

  2. পরীক্ষা করুন: উপরের কোডে REWORK_MULTIPLIER = 3.0-কে REWORK_MULTIPLIER = 1.0-এ পরিবর্তন করে Run চেপে আপনার অনুমান যাচাই করুন।

    রান করলে দেখা যাবে দুটো max() সার্চই এখন "গতি-সর্বস্ব (t=0.0)" স্ট্র্যাটেজিকে সেরা হিসেবে বেছে নিচ্ছে — কোড "কোনো গেমিং সনাক্ত হয়নি" বার্তা প্রিন্ট করবে। এটাই নিশ্চিত করে REWORK_MULTIPLIER-এর মান (অদেখা খরচের পরিমাণ) সরাসরি নির্ধারণ করে গেমিং ঘটবে কিনা।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • পরবর্তী পাঠ: গুডহার্টস ল ইন AI সিস্টেম পাঠ ২৫ এই একই ঘটনাকে একটি সাধারণ, বহু-ক্ষেত্রে প্রযোজ্য সূত্র হিসেবে দেখা হবে — একটি regression-based before/after correlation-divergence দিয়ে সত্যিই গণনা করে।
  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি, ট্রান্সপারেন্সি, AI অ্যালাইনমেন্ট, জেনারেটিভ AI/LLM এথিক্স, সামাজিক প্রভাব, গভর্নেন্স ও রেগুলেশন, সেক্টর-স্পেসিফিক এথিক্স ও এক্সিস্টেনশিয়াল রিস্ক বিতর্ক — বাকি পাঠগুলো শীঘ্রই যুক্ত হবে।
  • Ethics in Computing & AI Safety কোর্স সহোদর কোর্স একটি বিস্তৃত সার্ভে কোর্স যেখানে স্পেসিফিকেশন গেমিংয়ের একটি সংক্ষিপ্ত পরিচিতিও আছে — এই কোর্স সম্পূর্ণভাবে AI-তে ফোকাস করে গভীরে যায়।
আগের পাঠ
অ্যালাইনমেন্ট প্রবলেম — এর প্রকৃত অর্থ