পাঠ ৫৪ · ৫৭-এর মধ্যে · মডিউল ১২
Home / AI Courses / Human-Centered AI / মেট্রিক্স বনাম মানুষ — বিতর্ক

বিজনেস মেট্রিক্স বনাম হিউম্যান-সেন্টার্ড ফলাফল — একটি বিতর্ক

Balancing business metrics & human-centered outcomes — a debate
১০ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • কেন এই বিতর্ক আছে — বিজনেস মেট্রিক্স ও হিউম্যান-সেন্টার্ড ফলাফল কখন সত্যিই সাংঘর্ষিক হতে পারে
  • বিজনেস মেট্রিক্স অপ্টিমাইজেশনের পক্ষে তিনটি প্রধান যুক্তি
  • হিউম্যান-সেন্টার্ড ফলাফলকে অগ্রাধিকার দেওয়ার পক্ষে তিনটি প্রধান যুক্তি
  • একটি সত্যিকারের গণনা দিয়ে দেখা — একই ডিজাইন সিদ্ধান্ত কীভাবে দুটি মেট্রিক্সকে বিপরীত দিকে সরাতে পারে

১ · প্রেক্ষাপট — কেন এই বিতর্ক আছে

এই কোর্সের বেশিরভাগ পাঠ ধরে নিয়েছে যে ভালো ইন্টারঅ্যাকশন-ডিজাইন ও ভালো ব্যবসা একসাথে চলে — একজন ব্যবহারকারী যিনি বুঝতে পারেন, নিয়ন্ত্রণে থাকেন ও যথাযথভাবে বিশ্বাস করেন, তিনি সাধারণত দীর্ঘমেয়াদে বেশি সন্তুষ্ট ও অনুগত থাকেন। কিন্তু এটি সবসময় সত্য নয়। অনেক বাস্তব পরিস্থিতিতে, একটি নির্দিষ্ট ডিজাইন সিদ্ধান্ত স্বল্পমেয়াদী বিজনেস মেট্রিক্স (ক্লিক-থ্রু, সেশন-দৈর্ঘ্য, কনভার্সন রেট) বাড়াতে পারে, ঠিক একই সাথে ব্যবহারকারীর পার্সিভড-কন্ট্রোল, দীর্ঘমেয়াদী ট্রাস্ট বা সাধারণ ওয়েলবিয়িং কমাতে পারে — যেমন একটি জেনারেটিভ ফিড যা "নেক্সট" বাটনের বদলে স্বয়ংক্রিয়ভাবে পরবর্তী কনটেন্ট চালু করে দেয়, বা একটি রিমাইন্ডার সিস্টেম যা জরুরি-অনুভূতি তৈরি করে বেশি ফিরে-আসা নিশ্চিত করে। এটি এই ইন্ডাস্ট্রিতে একটি সৎ, প্রকৃতপক্ষে দ্বিমতপূর্ণ প্রশ্ন — উভয় পক্ষেই বিশ্বাসযোগ্য, চিন্তাশীল প্র্যাক্টিশনার ও গবেষক আছেন।

২ · পক্ষ ১ — বিজনেস মেট্রিক্স অপ্টিমাইজেশন একটি বৈধ, প্রয়োজনীয় অগ্রাধিকার

যুক্তি ১ — মেট্রিক্স প্রকৃত মূল্যের একটি পরিমাপযোগ্য প্রক্সি। এই পক্ষের যুক্তি হলো, এনগেজমেন্ট বা কনভার্সন নিজে থেকে "খারাপ" নয় — এগুলো প্রায়ই নির্দেশ করে ব্যবহারকারী প্রকৃতপক্ষে যা খুঁজছিলেন তা পাচ্ছেন। একজন ব্যবহারকারী একটি ফিচার বারবার ব্যবহার করেন কারণ এটি তার কাজে লাগে — এই সিগন্যালকে সন্দেহ করার আগে শক্তিশালী কারণ থাকা দরকার। দায়িত্বশীলভাবে বেছে নেওয়া মেট্রিক্স (শুধু সেশন-দৈর্ঘ্য নয়, বরং টাস্ক-সম্পূর্ণতা বা রিটার্ন-ভিজিট রেট) বাস্তবে ব্যবহারকারীর প্রকৃত সন্তুষ্টির সাথে যুক্তিসঙ্গতভাবে সংযুক্ত থাকতে পারে, এবং এগুলো ডিজাইন সিদ্ধান্তকে বিষয়ীগত অনুমানের বদলে পরীক্ষাযোগ্য প্রমাণের ভিত্তিতে নিতে সাহায্য করে (M9-এর A/B টেস্টিং প্র্যাকটিসের সাথে সংযুক্ত)।

যুক্তি ২ — ব্যবসার টিকে থাকা সব স্টেকহোল্ডারের স্বার্থে জরুরি। একটি প্রোডাক্ট যদি রাজস্ব উপার্জন না করে, তাহলে এটি একেবারেই টিকে থাকে না — এবং তখন কোনো ব্যবহারকারীই আর কোনো সুবিধা পান না, তা যত হিউম্যান-সেন্টার্ডভাবেই ডিজাইন করা হোক না কেন। এই পক্ষ যুক্তি দেন, কর্মী, বিনিয়োগকারী ও ব্যবহারকারী — সবার প্রতিই একটি কোম্পানির দায়বদ্ধতা আছে, এবং টেকসই রাজস্ব-মডেল ছাড়া একটি ফ্রি বা সাশ্রয়ী প্রোডাক্ট দীর্ঘমেয়াদে সবার জন্যই বন্ধ হয়ে যেতে পারে। তাদের মতে, বিজনেস মেট্রিক্সকে সম্পূর্ণভাবে "ব্যবহারকারীর বিরুদ্ধে" হিসেবে ফ্রেম করা একটি মিথ্যা বিরোধিতা — একটি টেকসই ব্যবসা ব্যবহারকারীর দীর্ঘমেয়াদী স্বার্থেরই পূর্বশর্ত।

যুক্তি ৩ — মেট্রিক্স বিষয়ীগত পিতৃতান্ত্রিক (paternalistic) অনুমানের চেয়ে বেশি বস্তুনিষ্ঠ। এই পক্ষ যুক্তি দেন, "ব্যবহারকারীর জন্য কোনটা প্রকৃতপক্ষে ভালো" — এই প্রশ্নের উত্তর একজন ডিজাইনারের নিজস্ব অনুমান থেকে আসা উচিত নয়; বরং A/B-টেস্টেড, পরিমাপযোগ্য মেট্রিক্স ব্যবহারকারীর প্রকৃত, প্রকাশিত পছন্দ (revealed preference) সম্পর্কে বেশি নির্ভরযোগ্য তথ্য দেয়। ডিজাইনাররা প্রায়ই নিজেদের অনুমান করা "ব্যবহারকারীর ভালো"-কে ব্যবহারকারীর প্রকৃত পছন্দের উপরে বসিয়ে দেওয়ার ঝুঁকিতে থাকেন — যা নিজেই এক ধরনের অসম্মানজনক পিতৃতান্ত্রিকতা হতে পারে বলে তারা মনে করেন।

৩ · পক্ষ ২ — হিউম্যান-সেন্টার্ড ফলাফলকে অগ্রাধিকার দেওয়া উচিত, এমনকি স্বল্পমেয়াদী মেট্রিক্সের বিনিময়েও

যুক্তি ১ — Goodhart's law: মেট্রিক্স টার্গেটে পরিণত হলে তা আর ভালো পরিমাপক থাকে না। এই পক্ষ যুক্তি দেন, যখনই একটি প্রক্সি মেট্রিক্স (এনগেজমেন্ট) সরাসরি অপ্টিমাইজেশন-টার্গেট হয়ে ওঠে, সিস্টেম প্রায়ই সেই মেট্রিক্স বাড়ানোর দ্রুততম পথ খুঁজে নেয় — যা প্রায়ই আসক্তিমূলক বা ম্যানিপুলেটিভ প্যাটার্নের দিকে নিয়ে যায় (L32-এর ডার্ক প্যাটার্ন আলোচনার সাথে সংযুক্ত), প্রকৃত মূল্য বৃদ্ধির দিকে নয়। রেকোমেন্ডেশন সিস্টেম ইন্ডাস্ট্রিতে এটি একটি ভালোভাবে-আলোচিত, স্বীকৃত প্যাটার্ন — সেশন-দৈর্ঘ্য অপ্টিমাইজেশন কখনো কখনো ব্যবহারকারীর নিজের-প্রতিবেদিত সন্তুষ্টি থেকে বিচ্ছিন্ন হয়ে যেতে পারে।

যুক্তি ২ — তথ্য-অসামঞ্জস্য ও স্বল্পমেয়াদী দৃষ্টিভঙ্গির ঝুঁকি। ব্যবহারকারীরা সবসময় একটি এনগেজমেন্ট-অপ্টিমাইজড ডিজাইনের দীর্ঘমেয়াদী খরচ (সময় নষ্ট, অতিরিক্ত-নির্ভরতা, মনোযোগ-ক্ষয়) মুহূর্তের মধ্যে স্পষ্টভাবে বুঝতে পারেন না — একটি "ক্লিক" মানেই সবসময় সচেতন, তথ্যপূর্ণ পছন্দ নয়। এই পক্ষ যুক্তি দেন, প্রোডাক্ট টিমের বেছে নেওয়া স্বল্পমেয়াদী মেট্রিক্স প্রায়ই কোম্পানির ত্রৈমাসিক লক্ষ্যের সময়সীমা প্রতিফলিত করে, ব্যবহারকারীর প্রকৃত দীর্ঘমেয়াদী স্বার্থ নয় — তাই "রেভিল্ড প্রেফারেন্স" যুক্তিটি নিজেই সন্দেহজনক যখন পছন্দটি সিস্টেম দ্বারা ইচ্ছাকৃতভাবে প্রভাবিত পরিবেশে করা হয়।

যুক্তি ৩ — ট্রাস্ট-ক্ষয়ের নিজস্ব দীর্ঘমেয়াদী বিজনেস-খরচ আছে। এই পক্ষ উল্লেখ করেন যে ব্যবহারকারী যখন বোঝেন তারা ম্যানিপুলেট হচ্ছেন, তখন রেগুলেটরি ব্যাকলাশ, ব্র্যান্ড-ট্রাস্ট ক্ষতি ও শেষ পর্যন্ত churn ঘটতে পারে — অর্থাৎ কিছু "হিউম্যান-সেন্টার্ড" বিনিয়োগ আসলে দীর্ঘমেয়াদী বিজনেস-মেট্রিক্সের সাথেই সংগতিপূর্ণ, শুধু স্বল্পমেয়াদী মেট্রিক্সের সাথে নয়। তাদের মতে, এটি দেখায় "বিজনেস বনাম হিউম্যান-সেন্টার্ড" ফ্রেমিংটি নিজেই মাঝেমধ্যে একটি মিথ্যা দ্বিধা — আসল দ্বন্দ্বটি প্রায়ই স্বল্পমেয়াদী বনাম দীর্ঘমেয়াদী বিজনেস স্বার্থের মধ্যে, যা "মানুষ বনাম মুনাফা" হিসেবে ভুলভাবে ফ্রেম করা হয়।

দুই পক্ষের মধ্যে ভারসাম্য

লক্ষণীয়, উভয় পক্ষই একমত যে ব্যবসার টিকে থাকা ও ব্যবহারকারীর প্রকৃত ভালো — দুটোই গুরুত্বপূর্ণ, এবং কেউই দাবি করেন না অন্যটি সম্পূর্ণ উপেক্ষা করা উচিত। মূল দ্বিমতটি হলো: মেট্রিক্স ব্যবহারকারীর প্রকৃত স্বার্থের কতটা নির্ভরযোগ্য প্রক্সি (এম্পিরিক্যাল প্রশ্ন), এবং স্বল্পমেয়াদী বনাম দীর্ঘমেয়াদী ট্রেডঅফে কতটা ওজন দেওয়া উচিত (একটি মূল্যবোধ-সম্পর্কিত প্রশ্ন)। বাস্তবে অনেক প্রোডাক্ট টিম একটি মিশ্র অবস্থান রাখেন — "উত্তর মেট্রিক্স" (guardrail metrics) ব্যবহার করেন যা এনগেজমেন্ট অপ্টিমাইজ করার পাশাপাশি ট্রাস্ট/কন্ট্রোল কমে যাচ্ছে কি না তাও একই সাথে ট্র্যাক করে।

৪ · একটি সত্যিকারের সিমুলেশন — একই ডিজাইন সিদ্ধান্ত, দুটি বিপরীত মেট্রিক্স

নিচের কোড সেলে দুটি সিমুলেটেড ডিজাইন-ভ্যারিয়েন্টের সেশন-ডেটা তৈরি করা হয়েছে: ভ্যারিয়েন্ট A (বিজনেস-অপ্টিমাইজড — বেশি urgency ও auto-play-স্টাইল প্যাটার্ন) এবং ভ্যারিয়েন্ট B (হিউম্যান-সেন্টার্ড — বেশি ব্যবহারকারী-নিয়ন্ত্রণ, কম চাপ)। এটি কোনো নির্দিষ্ট প্রকৃত কোম্পানির ডেটা নয় — একটি ইলাস্ট্রেটিভ, সিডেড সিমুলেশন যা শুধু দেখায় দুটি মেট্রিক্স কীভাবে বিপরীত দিকে সরতে পারে।

Python
import random
random.seed(21)

def simulate_variant(n, click_mean, control_mean_mu, control_sd=0.6):
    sessions = []
    for _ in range(n):
        clicks = max(0, round(random.gauss(click_mean, 1.2)))
        control = max(1, min(5, round(random.gauss(control_mean_mu, control_sd))))
        sessions.append((clicks, control))
    return sessions

# ভ্যারিয়েন্ট A: বিজনেস-অপ্টিমাইজড -- বেশি urgency/auto-play, বেশি ক্লিক প্রত্যাশিত
variant_a = simulate_variant(200, click_mean=6.4, control_mean_mu=2.6)
# ভ্যারিয়েন্ট B: হিউম্যান-সেন্টার্ড -- বেশি নিয়ন্ত্রণ, কম চাপ
variant_b = simulate_variant(200, click_mean=4.1, control_mean_mu=4.2)

def avg(pairs, idx):
    return sum(p[idx] for p in pairs) / len(pairs)

print(f"ভ্যারিয়েন্ট A (বিজনেস-অপ্টিমাইজড): গড় ক্লিক/সেশন = {avg(variant_a,0):.2f}   গড় পার্সিভড-কন্ট্রোল স্কোর (১-৫) = {avg(variant_a,1):.2f}")
print(f"ভ্যারিয়েন্ট B (হিউম্যান-সেন্টার্ড): গড় ক্লিক/সেশন = {avg(variant_b,0):.2f}   গড় পার্সিভড-কন্ট্রোল স্কোর (১-৫) = {avg(variant_b,1):.2f}")

engagement_gap = avg(variant_a,0) - avg(variant_b,0)
control_gap = avg(variant_b,1) - avg(variant_a,1)
print(f"\nএনগেজমেন্ট পার্থক্য (A - B): {engagement_gap:+.2f} ক্লিক/সেশন")
print(f"পার্সিভড-কন্ট্রোল পার্থক্য (B - A): {control_gap:+.2f} পয়েন্ট")

    
আউটপুটে দেখা যায় — ভ্যারিয়েন্ট A গড়ে ৬.৫৫ ক্লিক/সেশন পায় কিন্তু পার্সিভড-কন্ট্রোল স্কোর মাত্র ২.৬০; ভ্যারিয়েন্ট B গড়ে কম, ৩.৯৬ ক্লিক/সেশন পায় কিন্তু পার্সিভড-কন্ট্রোল স্কোর ৪.২০ — উল্লেখযোগ্যভাবে বেশি। এনগেজমেন্ট পার্থক্য +২.৫৯ ক্লিক/সেশন (A-এর পক্ষে), কিন্তু কন্ট্রোল পার্থক্য +১.৬০ পয়েন্ট (B-এর পক্ষে) — দুটো মেট্রিক্স সত্যিই বিপরীত দিকে সরেছে। এই সিমুলেশনটি কোনো পক্ষ "জিতেছে" তা বলে না — এটি শুধু নিশ্চিত করে যে এই টেনশনটি বাস্তব: যদি শুধু ক্লিক-সংখ্যা দিয়ে সিদ্ধান্ত নেওয়া হয়, ভ্যারিয়েন্ট A "জিতবে"; যদি পার্সিভড-কন্ট্রোল দিয়ে নেওয়া হয়, ভ্যারিয়েন্ট B "জিতবে" — কোন মেট্রিক্সকে অগ্রাধিকার দেওয়া হবে, সেটিই আসল সিদ্ধান্ত।
পরবর্তী পাঠের প্রস্তুতি

এই পাঠ আজকের ডিজাইন-সিদ্ধান্তে বিজনেস মেট্রিক্স ও হিউম্যান-সেন্টার্ড ফলাফলের মধ্যে টেনশন কভার করেছে। L55-এ আমরা একই ধরনের ভারসাম্যপূর্ণ মানদণ্ড বজায় রেখে একটি ভবিষ্যৎমুখী প্রশ্নে যাই — AI ক্যাপাবিলিটি বাড়ার সাথে সাথে ইন্টারঅ্যাকশন-ডিজাইনে অটোনমি বনাম হিউম্যান-কন্ট্রোলের ভারসাম্য কোন দিকে সরা উচিত।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ পক্ষ ২-এর "যুক্তি ৩" (ট্রাস্ট-ক্ষয়ের নিজস্ব বিজনেস-খরচ আছে) যদি সত্যি হয়, তাহলে এই পুরো বিতর্কের ফ্রেমিং নিয়েই কী প্রশ্ন উঠতে পারে?

যদি "হিউম্যান-সেন্টার্ড" ডিজাইন প্রকৃতপক্ষে দীর্ঘমেয়াদী বিজনেস-মেট্রিক্সের সাথেই সংগতিপূর্ণ হয়, তাহলে প্রশ্ন ওঠে — এটি আসলে "বিজনেস বনাম মানুষ" একটি শূন্য-সমষ্টি ট্রেডঅফ কি না, নাকি প্রায়ই একটি স্বল্পমেয়াদী বনাম দীর্ঘমেয়াদী বিজনেস-দৃষ্টিভঙ্গির পার্থক্য। তবে এটি বিতর্কটি সম্পূর্ণ নিষ্পত্তি করে না — কিছু ক্ষেত্রে সত্যিই কোনো দীর্ঘমেয়াদী বিজনেস-উপকার ছাড়াই সরাসরি ট্রেডঅফ থেকে যায়।

প্র ০২ পক্ষ ১-এর "যুক্তি ৩"-এ বলা হয়েছে মেট্রিক্স "বস্তুনিষ্ঠ" প্রমাণ দেয়, ডিজাইনারের অনুমানের চেয়ে বেশি নির্ভরযোগ্য। পক্ষ ২-এর "যুক্তি ১" (Goodhart's law) কি এই যুক্তিকে সরাসরি খণ্ডন করে?

আংশিকভাবে — Goodhart's law-এর যুক্তিটি বলে না যে মেট্রিক্স সবসময় অবিশ্বাস্য; এটি বলে মেট্রিক্স সরাসরি অপ্টিমাইজেশন-টার্গেট হয়ে উঠলে সেটির নির্ভরযোগ্যতা কমে যায়। অর্থাৎ একটি মেট্রিক্স পর্যবেক্ষণ হিসেবে তথ্যপূর্ণ থাকতে পারে, কিন্তু সরাসরি অপ্টিমাইজেশন-লুপে বসানো হলে তার আচরণ বদলে যায় — এটি দুটো যুক্তিকে সম্পূর্ণ বিরোধী না করে বরং একটি গুরুত্বপূর্ণ শর্ত (কীভাবে মেট্রিক্স ব্যবহার হচ্ছে) যোগ করে।

প্র ০৩ উপরের কোড সেলে n=200-এর বদলে n=1000 ব্যবহার করলে গড় মানগুলো কি উল্লেখযোগ্যভাবে বদলাবে বলে আপনার ধারণা? এটি বিতর্কের কোন দিকটির সাথে সম্পর্কিত?

বড় স্যাম্পল সাইজে গড় মান আসল "সিমুলেশন প্যারামিটার"-এর (click_mean, control_mean_mu) কাছাকাছি আরও স্থিতিশীল হয়ে আসার কথা, কারণ র‍্যান্ডম শব্দ (noise) গড়ে-ভাগ হয়ে কমে যায়। এটি সরাসরি A/B টেস্টিং-এর (M9) একটি মূল বিষয়ের সাথে সম্পর্কিত — ছোট স্যাম্পলে দেখা "পার্থক্য" নেহাত কাকতালীয় হতে পারে, তাই বাস্তব প্রোডাক্ট সিদ্ধান্তে পর্যাপ্ত স্যাম্পল সাইজ ছাড়া কোনো মেট্রিক্স-পার্থক্যকে নির্ভরযোগ্য ধরা উচিত নয়।

অনুশীলন

  1. চিন্তা করুন: উপরের কোড সেলে n=200-কে n=1000-এ বাড়ালে, ভ্যারিয়েন্ট A ও B-এর গড় ক্লিক ও কন্ট্রোল স্কোর মোটামুটি কোন মানের কাছাকাছি আসবে বলে আপনার ধারণা?

    যেহেতু simulate_variant-এ ব্যবহৃত গড় (mean) মানগুলো সরাসরি click_mean/control_mean_mu প্যারামিটার থেকে আসে, বড় স্যাম্পলে ফলাফল সেই প্যারামিটারগুলোর (A: ৬.৪ ও ২.৬; B: ৪.১ ও ৪.২) খুব কাছাকাছি আসার কথা, ছোট স্যাম্পলের র‍্যান্ডম ওঠানামা কমে গিয়ে।

  2. পরীক্ষা করুন: উপরের কোড সেলে simulate_variant(200, ...)-এর দুটি কলেই 200-কে 1000-এ পরিবর্তন করে Run চেপে আপনার অনুমান যাচাই করুন।

    n=1000-এ ভ্যারিয়েন্ট A-এর গড় ক্লিক ৬.৩৫ ও কন্ট্রোল ২.৫৩-এ আসে, আর ভ্যারিয়েন্ট B-এর গড় ক্লিক ৪.১০ ও কন্ট্রোল ৪.২৩-এ আসে — n=200-এর ফলাফলের (৬.৫৫/২.৬০ এবং ৩.৯৬/৪.২০) খুব কাছাকাছি, ঠিক অনুমান অনুযায়ী। মূল প্যাটার্নটি (A বেশি এনগেজমেন্ট, B বেশি কন্ট্রোল) দুটো স্যাম্পল সাইজেই স্থিতিশীলভাবে বজায় থাকে।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ ব্যবহারকারী ও প্রেক্ষাপট, ট্রাস্ট ক্যালিব্রেশন, এক্সপ্লেইনেবিলিটি, হিউম্যান-ইন-দ্য-লুপ ডিজাইন, কগনিটিভ লোড, অ্যাক্সেসিবিলিটি, হিউম্যান-AI টিমিং, ইউজেবিলিটি ইভালুয়েশন, ইন্ডাস্ট্রি ফ্রেমওয়ার্ক, গভর্নেন্স ও ক্যাপস্টোন — বাকি পাঠগুলো শীঘ্রই যুক্ত হবে।
  • AI Ethics কোর্স সহোদর কোর্স ডার্ক প্যাটার্ন, ম্যানিপুলেশন ও ভোক্তা-সুরক্ষার নৈতিক ফ্রেমওয়ার্ক গভীরভাবে কভার করে — এই কোর্স সেই ভিত্তির উপর ইন্টারঅ্যাকশন-ডিজাইন টেনশনের দিকটি যোগ করে।
  • সব Courses দেখুন ABCL TECH C, C++, Python, Java, JavaScript, DSA, Machine Learning, Deep Learning, System Design, Cybersecurity, Cloud Computing & DevOps, এবং আরও অনেক কোর্স — সব এক জায়গায়।
আগের পাঠ
হিউম্যান-সেন্টার্ড AI ডেভেলপমেন্টের জন্য প্রাতিষ্ঠানিক প্র্যাকটিস