পাঠ ০৫ · ৫৭-এর মধ্যে · মডিউল ২
Home / AI Courses / Human-Centered AI / ইউজার রিসার্চ

AI সিস্টেমের জন্য ইউজার রিসার্চ

User research for AI systems
৭ মিনিট পড়া মধ্যম · Intermediate Python কোডসহ সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • AI সিস্টেমের ইউজার রিসার্চ কীভাবে ঐতিহ্যগত সফটওয়্যার UX রিসার্চ থেকে আলাদা
  • ইন্টারভিউ ও কনটেক্সচুয়াল ইনকোয়ারি — কখন কোনটি ব্যবহার করবেন
  • কেন "যথেষ্ট ভালো"-এর সংজ্ঞা প্রেক্ষাপট অনুযায়ী বদলে যায়, এবং কীভাবে সেটা রিসার্চ দিয়ে বের করবেন
  • ডেভেলপারের অনুমান বনাম বাস্তব ব্যবহারকারীর চাহিদার ফারাক — একটি সত্যিকারের কোড ডেমো দিয়ে

১ · কেন AI সিস্টেমের ইউজার রিসার্চ আলাদা

ঐতিহ্যগত সফটওয়্যারে আচরণ predictable — একটি বাটনে ক্লিক করলে সবসময় একই জিনিস ঘটে। ইউজার রিসার্চ তখন মূলত প্রশ্ন করে: ইন্টারফেসটি কি বোধগম্য, ব্যবহারযোগ্য? কিন্তু AI সিস্টেমAI সিস্টেমএমন একটি সফটওয়্যার সিস্টেম যার আউটপুট সম্ভাব্যতা-ভিত্তিক এবং প্রতিটি ইনপুটে ভিন্ন হতে পারে, এবং যা মাঝেমধ্যেই ভুল করবে।-এর ক্ষেত্রে আউটপুট সম্ভাব্যতা-ভিত্তিক — একই ইনপুটেও কখনও ঠিক, কখনও ভুল ফলাফল আসতে পারে। তাই ইউজার রিসার্চে শুধু "ইন্টারফেস বোধগম্য কিনা" নয়, বরং আরও গভীর প্রশ্ন করতে হয়:

ভুল হলে কী ঘটে
ব্যবহারকারী কি AI-এর ভুল চিনতে পারবেন? সেই ভুলের বাস্তব-জীবনে কী পরিণতি হবে?
কতটা নিয়ন্ত্রণ দরকার
ব্যবহারকারী কি AI-কে পুরোপুরি স্বয়ংক্রিয়ভাবে কাজ করতে দিতে চান, নাকি প্রতিটি ধাপে যাচাই চান?
প্রকৃত আচরণ বনাম মুখের কথা
ব্যবহারকারী বলতে পারেন "আমি সব সময় AI-এর ফলাফল যাচাই করি" — কিন্তু বাস্তবে হয়তো করেন না। এটাই স্টেটেড বনাম রিভিলড প্রেফারেন্সের সমস্যা।

২ · দুটি মূল পদ্ধতি — ইন্টারভিউ ও কনটেক্সচুয়াল ইনকোয়ারি

ইন্টারভিউ ব্যবহারকারীর মতামত, প্রত্যাশা ও অতীত অভিজ্ঞতা জানার জন্য ভালো — বিশেষ করে "আপনি কখন AI-এর পরামর্শ বিশ্বাস করেন না?" জাতীয় প্রশ্নের জন্য। কিন্তু ইন্টারভিউয়ের সীমাবদ্ধতা হলো এটি স্মৃতি ও স্ব-প্রতিবেদনের (self-report) উপর নির্ভরশীল — মানুষ প্রায়ই নিজের আচরণ নিজেই সঠিকভাবে বর্ণনা করতে পারেন না।

কনটেক্সচুয়াল ইনকোয়ারিকনটেক্সচুয়াল ইনকোয়ারিএকটি রিসার্চ পদ্ধতি যেখানে গবেষক ব্যবহারকারীকে তার নিজের বাস্তব পরিবেশে, তার স্বাভাবিক কাজ করার সময় পর্যবেক্ষণ করেন — ল্যাবে ডেকে এনে নয়। এই সীমাবদ্ধতা কমায় — গবেষক ব্যবহারকারীর নিজের কর্মক্ষেত্রে বা বাস্তব পরিবেশে গিয়ে দেখেন তিনি প্রকৃতপক্ষে কীভাবে AI টুলটি ব্যবহার করছেন। AI প্রোডাক্টের জন্য এটি বিশেষভাবে গুরুত্বপূর্ণ, কারণ over-reliance বা under-reliance-এর মতো আচরণ (M3-এ বিস্তারিত) প্রায়ই ব্যবহারকারী নিজে খেয়ালও করেন না — যেমন একজন ব্যবহারকারী হয়তো বলবেন "আমি সবসময় ফলাফল চেক করি," কিন্তু বাস্তবে দ্রুত ডেডলাইনের চাপে থাকলে সেটা বাদ দিয়ে দেন — এই ফারাকটা শুধু সরাসরি পর্যবেক্ষণেই ধরা পড়ে।

ব্যবহারিক টিপ

সবচেয়ে কার্যকর হয় দুটো পদ্ধতির সমন্বয়: প্রথমে কনটেক্সচুয়াল ইনকোয়ারি দিয়ে বাস্তব আচরণ পর্যবেক্ষণ করা, তারপর সেই পর্যবেক্ষণ নিয়ে ইন্টারভিউতে ফিরে গিয়ে জিজ্ঞাসা করা — "আপনি এই মুহূর্তে সাজেশনটি না দেখেই accept করলেন, এটা কি স্বাভাবিক, নাকি আজ আপনি তাড়াহুড়োয় ছিলেন?"

৩ · "যথেষ্ট ভালো" প্রেক্ষাপট অনুযায়ী বদলায়

ডেভেলপাররা প্রায়ই ধরে নেন একটি একক "acceptable error rate" পুরো প্রোডাক্টে খাটবে। কিন্তু বাস্তবে ব্যবহারকারীর ভুল-সহনশীলতা নির্ভর করে সেই ভুলের পরিণতির উপর। নিচের কোড সেলে দুটো ভিন্ন AI ফিচারের জন্য সিমুলেটেড ব্যবহারকারী-সার্ভে রেটিং (১-৫ স্কেলে, ৫ = "মাঝেমধ্যে ভুল হলেও ঠিক আছে") অ্যাগ্রিগেট করে দেখা যাক তাদের মধ্যে কতটা ফারাক থাকে, এবং ডেভেলপারের একটি "সবার জন্য একই" অনুমান থেকে সেই বাস্তবতা কতটা দূরে।

Python
import statistics

# ১০ জন সিমুলেটেড ব্যবহারকারীর সার্ভে রেটিং, স্কেল ১-৫
# ৫ = "মাঝেমধ্যে ভুল হলেও সমস্যা নেই", ১ = "কোনো ভুল একদমই সহনীয় নয়"
survey_responses = {
    "স্প্যাম ফিল্টার (ভুল হলে একটা ইমেইল মিস হয়)": [4, 5, 5, 4, 5, 3, 4, 5, 5, 4],
    "মেডিকেল ডায়াগনসিস সাজেশন (ভুল হলে ভুল চিকিৎসার ঝুঁকি)": [1, 2, 1, 1, 2, 1, 1, 2, 1, 1],
}

# ডেভেলপারের অনুমান: "একটা মাঝারি-মাত্রার সহনশীলতা সব ফিচারেই যথেষ্ট হবে"
developer_assumption = 3.0

for feature, responses in survey_responses.items():
    actual_mean = statistics.mean(responses)
    gap = actual_mean - developer_assumption
    print(f"{feature}")
    print(f"  বাস্তব ব্যবহারকারীদের গড় সহনশীলতা: {actual_mean:.1f}/৫")
    print(f"  ডেভেলপারের অনুমান (৩.০) থেকে পার্থক্য: {gap:+.1f}")
    print()

    
দেখা যাচ্ছে স্প্যাম ফিল্টারের জন্য বাস্তব সহনশীলতার গড় ৪.৪ — ডেভেলপারের অনুমান থেকে +১.৪ বেশি (ব্যবহারকারীরা ডেভেলপারের ধারণার চেয়েও বেশি সহনশীল, তাই এখানে অতিরিক্ত সতর্কতা অপ্রয়োজনীয় ঘর্ষণ তৈরি করতে পারে)। কিন্তু মেডিকেল সাজেশনের জন্য গড় মাত্র ১.৩ — অনুমান থেকে -১.৭ কম। একটি একক "৩.০" অনুমান দিয়ে দুটো ফিচারই ডিজাইন করলে দুটোতেই ভুল সিদ্ধান্ত হবে: স্প্যাম ফিল্টারে অকারণে বেশি confirmation চাওয়া, আর মেডিকেল ফিচারে যথেষ্ট সতর্কতা না রাখা। এটাই দেখায় কেন প্রতিটি AI ফিচারের জন্য আলাদাভাবে রিসার্চ করা দরকার — একটি সংখ্যা সব প্রেক্ষাপটে খাটে না (M7-এ high-stakes প্রেক্ষাপটের ডিজাইন নিয়ে আরও বিস্তারিত)।
মূল কথা · Key takeaway

AI সিস্টেমের ইউজার রিসার্চের কাজ শুধু ফিচার-আইডিয়া যাচাই করা নয় — এটি বের করে আনে ব্যবহারকারী কতটা ভুল সহ্য করতে পারবেন, কখন তিনি নিয়ন্ত্রণ চান, এবং তার প্রকৃত (বলা নয়, করা) আচরণ কী। পরবর্তী পাঠে (L06) আমরা দেখব ব্যবহারকারীরা AI কীভাবে কাজ করে সে সম্পর্কে কী ধরনের (প্রায়ই ভুল) মানসিক মডেল তৈরি করেন — এবং সেটা কীভাবে এই একই রিসার্চ পদ্ধতি দিয়ে ধরা পড়ে।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ একজন ব্যবহারকারী ইন্টারভিউতে বলেন "আমি সবসময় AI-এর প্রতিটি সাজেশন মনোযোগ দিয়ে যাচাই করি।" এই কথাটি কেন কনটেক্সচুয়াল ইনকোয়ারি ছাড়া যথেষ্ট নাও হতে পারে?

মানুষ নিজের গড় আচরণ মনে রাখেন, কিন্তু চাপের মুহূর্তে (ডেডলাইন, ক্লান্তি, ব্যস্ততা) কী করেন তা প্রায়ই ভুলে যান বা কম গুরুত্ব দেন। ইন্টারভিউ পুরনো স্মৃতি ও স্ব-চিত্রের উপর নির্ভর করে, যেখানে কনটেক্সচুয়াল ইনকোয়ারি বাস্তব মুহূর্তে ঘটা আচরণ ধরে ফেলে — যেমন ঠিক ওই মুহূর্তে তাড়াহুড়োয় যাচাই না করেই সাজেশন accept করে ফেলা।

প্র ০২ উপরের ডেমোতে দুটো ফিচারের সহনশীলতার গড় এত আলাদা কেন? এই ফারাকটা ডিজাইন সিদ্ধান্তে কীভাবে প্রতিফলিত হওয়া উচিত?

ফারাকের মূল কারণ হলো ভুলের পরিণতির severity — স্প্যাম ফিল্টারে ভুল হলে সর্বোচ্চ একটা ইমেইল মিস হয় (সহজে ফিরে পাওয়া যায়), কিন্তু মেডিকেল সাজেশনে ভুল হলে স্বাস্থ্যের ক্ষতি হতে পারে (প্রায়ই অপরিবর্তনীয়)। ডিজাইনে এর মানে হলো: স্প্যাম ফিল্টারে হালকা, অনুপ্রবেশহীন ইন্টারফেস ঠিক আছে, কিন্তু মেডিকেল ফিচারে স্পষ্ট কনফিডেন্স ইঙ্গিত, বাধ্যতামূলক human review, এবং সহজ ওভাররাইড অপশন থাকতে হবে (M7, M5-এ বিস্তারিত)।

প্র ০৩ আপনি যদি এমন একটি AI ফিচারের ইউজার রিসার্চ করতেন যেটা আপনি নিজে কখনও ব্যবহার করেননি (যেমন কৃষি সহায়ক AI, যদি আপনি কৃষক না হন) — কোন পদ্ধতিটি বেশি জরুরি হবে, ইন্টারভিউ নাকি কনটেক্সচুয়াল ইনকোয়ারি, এবং কেন?

এমন ক্ষেত্রে কনটেক্সচুয়াল ইনকোয়ারি বিশেষভাবে জরুরি, কারণ গবেষকের নিজের অভিজ্ঞতা বা অনুমান দিয়ে প্রশ্নগুলো তৈরি করা কঠিন — তিনি জানেন না কী জিজ্ঞাসা করা উচিত। ব্যবহারকারীর নিজের পরিবেশে গিয়ে পর্যবেক্ষণ করলে এমন প্রেক্ষাপট-নির্দিষ্ট চাহিদা ও বাধা ধরা পড়ে যা আগে থেকে ধারণাই করা যেত না — যেমন নেটওয়ার্ক-সীমাবদ্ধ এলাকায় অফলাইন কাজ করার প্রয়োজনীয়তা।

অনুশীলন

  1. চিন্তা করুন: উপরের কোড সেলে যদি মেডিকেল ফিচারের রেটিংগুলোর একটি ৪-এ পরিবর্তন করা হয় (যেমন একজন ব্যবহারকারী বেশি সহনশীল), তাহলে গড় কি ডেভেলপারের অনুমান ৩.০-এর কাছাকাছি চলে আসবে বলে আপনার ধারণা?

    একটি মাত্র মান বাড়ালে গড় সামান্য বাড়বে, কিন্তু ১০টি রেটিংয়ের একটি বদলালে খুব বেশি প্রভাব পড়বে না — বাকি ৯টি রেটিং এখনও নিচের দিকে (১-২)। এটা একটি গুরুত্বপূর্ণ পয়েন্ট দেখায়: একটি বহিরাগত (outlier) মতামত পুরো গড়কে বদলে দেয় না, তাই ডিজাইন সিদ্ধান্ত একজনের মতামতের উপর ভিত্তি করে না করে পুরো ডিস্ট্রিবিউশন দেখে নেওয়া উচিত।

  2. পরীক্ষা করুন: উপরের কোড সেলে মেডিকেল ফিচারের তালিকার প্রথম মান 1-কে 4-এ পরিবর্তন করে (অর্থাৎ [4, 2, 1, 1, 2, 1, 1, 2, 1, 1]) Run চেপে আপনার অনুমান যাচাই করুন।

    নতুন গড় হয় ১.৬ (আগে ছিল ১.৩) — সামান্য বেড়েছে কিন্তু এখনও ডেভেলপারের অনুমান ৩.০ থেকে অনেক দূরে (পার্থক্য -১.৪)। এটাই প্রমাণ করে একজনের মতামত পুরো প্যাটার্ন বদলাতে পারে না — সিদ্ধান্ত নিতে হয় পর্যাপ্ত নমুনার সামগ্রিক প্রবণতা দেখে।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

  • কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ ট্রাস্ট ক্যালিব্রেশন, এক্সপ্লেইনেবিলিটি, হিউম্যান-ইন-দ্য-লুপ ডিজাইন, কগনিটিভ লোড, অ্যাক্সেসিবিলিটি, হিউম্যান-AI টিমিং, ইউজেবিলিটি ইভালুয়েশন, ইন্ডাস্ট্রি ফ্রেমওয়ার্ক ও ক্যাপস্টোন।
  • AI Ethics কোর্স সহোদর কোর্স নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি ও AI অ্যালাইনমেন্টের গভীর কভারেজ — ইউজার রিসার্চ থেকে বের হওয়া ভালনারেবিলিটি ইস্যুর নৈতিক দিক সেখানে বিস্তারিত।
  • সব Courses দেখুন ABCL TECH C, C++, Python, Java, JavaScript, DSA, Machine Learning, Deep Learning, System Design, Cybersecurity, Cloud Computing & DevOps, এবং আরও অনেক কোর্স — সব এক জায়গায়।
আগের পাঠ
Shneiderman-এর HCAI ফ্রেমওয়ার্ক — রিলায়েবল, সেফ ও ট্রাস্টওয়ার্দি