AI সিস্টেমের জন্য ইউজার রিসার্চ
এই পাঠে যা শিখবেন
- AI সিস্টেমের ইউজার রিসার্চ কীভাবে ঐতিহ্যগত সফটওয়্যার UX রিসার্চ থেকে আলাদা
- ইন্টারভিউ ও কনটেক্সচুয়াল ইনকোয়ারি — কখন কোনটি ব্যবহার করবেন
- কেন "যথেষ্ট ভালো"-এর সংজ্ঞা প্রেক্ষাপট অনুযায়ী বদলে যায়, এবং কীভাবে সেটা রিসার্চ দিয়ে বের করবেন
- ডেভেলপারের অনুমান বনাম বাস্তব ব্যবহারকারীর চাহিদার ফারাক — একটি সত্যিকারের কোড ডেমো দিয়ে
১ · কেন AI সিস্টেমের ইউজার রিসার্চ আলাদা
ঐতিহ্যগত সফটওয়্যারে আচরণ predictable — একটি বাটনে ক্লিক করলে সবসময় একই জিনিস ঘটে। ইউজার রিসার্চ তখন মূলত প্রশ্ন করে: ইন্টারফেসটি কি বোধগম্য, ব্যবহারযোগ্য? কিন্তু AI সিস্টেমAI সিস্টেমএমন একটি সফটওয়্যার সিস্টেম যার আউটপুট সম্ভাব্যতা-ভিত্তিক এবং প্রতিটি ইনপুটে ভিন্ন হতে পারে, এবং যা মাঝেমধ্যেই ভুল করবে।-এর ক্ষেত্রে আউটপুট সম্ভাব্যতা-ভিত্তিক — একই ইনপুটেও কখনও ঠিক, কখনও ভুল ফলাফল আসতে পারে। তাই ইউজার রিসার্চে শুধু "ইন্টারফেস বোধগম্য কিনা" নয়, বরং আরও গভীর প্রশ্ন করতে হয়:
ব্যবহারকারী কি AI-এর ভুল চিনতে পারবেন? সেই ভুলের বাস্তব-জীবনে কী পরিণতি হবে?
ব্যবহারকারী কি AI-কে পুরোপুরি স্বয়ংক্রিয়ভাবে কাজ করতে দিতে চান, নাকি প্রতিটি ধাপে যাচাই চান?
ব্যবহারকারী বলতে পারেন "আমি সব সময় AI-এর ফলাফল যাচাই করি" — কিন্তু বাস্তবে হয়তো করেন না। এটাই স্টেটেড বনাম রিভিলড প্রেফারেন্সের সমস্যা।
২ · দুটি মূল পদ্ধতি — ইন্টারভিউ ও কনটেক্সচুয়াল ইনকোয়ারি
ইন্টারভিউ ব্যবহারকারীর মতামত, প্রত্যাশা ও অতীত অভিজ্ঞতা জানার জন্য ভালো — বিশেষ করে "আপনি কখন AI-এর পরামর্শ বিশ্বাস করেন না?" জাতীয় প্রশ্নের জন্য। কিন্তু ইন্টারভিউয়ের সীমাবদ্ধতা হলো এটি স্মৃতি ও স্ব-প্রতিবেদনের (self-report) উপর নির্ভরশীল — মানুষ প্রায়ই নিজের আচরণ নিজেই সঠিকভাবে বর্ণনা করতে পারেন না।
কনটেক্সচুয়াল ইনকোয়ারিকনটেক্সচুয়াল ইনকোয়ারিএকটি রিসার্চ পদ্ধতি যেখানে গবেষক ব্যবহারকারীকে তার নিজের বাস্তব পরিবেশে, তার স্বাভাবিক কাজ করার সময় পর্যবেক্ষণ করেন — ল্যাবে ডেকে এনে নয়। এই সীমাবদ্ধতা কমায় — গবেষক ব্যবহারকারীর নিজের কর্মক্ষেত্রে বা বাস্তব পরিবেশে গিয়ে দেখেন তিনি প্রকৃতপক্ষে কীভাবে AI টুলটি ব্যবহার করছেন। AI প্রোডাক্টের জন্য এটি বিশেষভাবে গুরুত্বপূর্ণ, কারণ over-reliance বা under-reliance-এর মতো আচরণ (M3-এ বিস্তারিত) প্রায়ই ব্যবহারকারী নিজে খেয়ালও করেন না — যেমন একজন ব্যবহারকারী হয়তো বলবেন "আমি সবসময় ফলাফল চেক করি," কিন্তু বাস্তবে দ্রুত ডেডলাইনের চাপে থাকলে সেটা বাদ দিয়ে দেন — এই ফারাকটা শুধু সরাসরি পর্যবেক্ষণেই ধরা পড়ে।
সবচেয়ে কার্যকর হয় দুটো পদ্ধতির সমন্বয়: প্রথমে কনটেক্সচুয়াল ইনকোয়ারি দিয়ে বাস্তব আচরণ পর্যবেক্ষণ করা, তারপর সেই পর্যবেক্ষণ নিয়ে ইন্টারভিউতে ফিরে গিয়ে জিজ্ঞাসা করা — "আপনি এই মুহূর্তে সাজেশনটি না দেখেই accept করলেন, এটা কি স্বাভাবিক, নাকি আজ আপনি তাড়াহুড়োয় ছিলেন?"
৩ · "যথেষ্ট ভালো" প্রেক্ষাপট অনুযায়ী বদলায়
ডেভেলপাররা প্রায়ই ধরে নেন একটি একক "acceptable error rate" পুরো প্রোডাক্টে খাটবে। কিন্তু বাস্তবে ব্যবহারকারীর ভুল-সহনশীলতা নির্ভর করে সেই ভুলের পরিণতির উপর। নিচের কোড সেলে দুটো ভিন্ন AI ফিচারের জন্য সিমুলেটেড ব্যবহারকারী-সার্ভে রেটিং (১-৫ স্কেলে, ৫ = "মাঝেমধ্যে ভুল হলেও ঠিক আছে") অ্যাগ্রিগেট করে দেখা যাক তাদের মধ্যে কতটা ফারাক থাকে, এবং ডেভেলপারের একটি "সবার জন্য একই" অনুমান থেকে সেই বাস্তবতা কতটা দূরে।
import statistics
# ১০ জন সিমুলেটেড ব্যবহারকারীর সার্ভে রেটিং, স্কেল ১-৫
# ৫ = "মাঝেমধ্যে ভুল হলেও সমস্যা নেই", ১ = "কোনো ভুল একদমই সহনীয় নয়"
survey_responses = {
"স্প্যাম ফিল্টার (ভুল হলে একটা ইমেইল মিস হয়)": [4, 5, 5, 4, 5, 3, 4, 5, 5, 4],
"মেডিকেল ডায়াগনসিস সাজেশন (ভুল হলে ভুল চিকিৎসার ঝুঁকি)": [1, 2, 1, 1, 2, 1, 1, 2, 1, 1],
}
# ডেভেলপারের অনুমান: "একটা মাঝারি-মাত্রার সহনশীলতা সব ফিচারেই যথেষ্ট হবে"
developer_assumption = 3.0
for feature, responses in survey_responses.items():
actual_mean = statistics.mean(responses)
gap = actual_mean - developer_assumption
print(f"{feature}")
print(f" বাস্তব ব্যবহারকারীদের গড় সহনশীলতা: {actual_mean:.1f}/৫")
print(f" ডেভেলপারের অনুমান (৩.০) থেকে পার্থক্য: {gap:+.1f}")
print()
AI সিস্টেমের ইউজার রিসার্চের কাজ শুধু ফিচার-আইডিয়া যাচাই করা নয় — এটি বের করে আনে ব্যবহারকারী কতটা ভুল সহ্য করতে পারবেন, কখন তিনি নিয়ন্ত্রণ চান, এবং তার প্রকৃত (বলা নয়, করা) আচরণ কী। পরবর্তী পাঠে (L06) আমরা দেখব ব্যবহারকারীরা AI কীভাবে কাজ করে সে সম্পর্কে কী ধরনের (প্রায়ই ভুল) মানসিক মডেল তৈরি করেন — এবং সেটা কীভাবে এই একই রিসার্চ পদ্ধতি দিয়ে ধরা পড়ে।
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ একজন ব্যবহারকারী ইন্টারভিউতে বলেন "আমি সবসময় AI-এর প্রতিটি সাজেশন মনোযোগ দিয়ে যাচাই করি।" এই কথাটি কেন কনটেক্সচুয়াল ইনকোয়ারি ছাড়া যথেষ্ট নাও হতে পারে?
মানুষ নিজের গড় আচরণ মনে রাখেন, কিন্তু চাপের মুহূর্তে (ডেডলাইন, ক্লান্তি, ব্যস্ততা) কী করেন তা প্রায়ই ভুলে যান বা কম গুরুত্ব দেন। ইন্টারভিউ পুরনো স্মৃতি ও স্ব-চিত্রের উপর নির্ভর করে, যেখানে কনটেক্সচুয়াল ইনকোয়ারি বাস্তব মুহূর্তে ঘটা আচরণ ধরে ফেলে — যেমন ঠিক ওই মুহূর্তে তাড়াহুড়োয় যাচাই না করেই সাজেশন accept করে ফেলা।
প্র ০২ উপরের ডেমোতে দুটো ফিচারের সহনশীলতার গড় এত আলাদা কেন? এই ফারাকটা ডিজাইন সিদ্ধান্তে কীভাবে প্রতিফলিত হওয়া উচিত?
ফারাকের মূল কারণ হলো ভুলের পরিণতির severity — স্প্যাম ফিল্টারে ভুল হলে সর্বোচ্চ একটা ইমেইল মিস হয় (সহজে ফিরে পাওয়া যায়), কিন্তু মেডিকেল সাজেশনে ভুল হলে স্বাস্থ্যের ক্ষতি হতে পারে (প্রায়ই অপরিবর্তনীয়)। ডিজাইনে এর মানে হলো: স্প্যাম ফিল্টারে হালকা, অনুপ্রবেশহীন ইন্টারফেস ঠিক আছে, কিন্তু মেডিকেল ফিচারে স্পষ্ট কনফিডেন্স ইঙ্গিত, বাধ্যতামূলক human review, এবং সহজ ওভাররাইড অপশন থাকতে হবে (M7, M5-এ বিস্তারিত)।
প্র ০৩ আপনি যদি এমন একটি AI ফিচারের ইউজার রিসার্চ করতেন যেটা আপনি নিজে কখনও ব্যবহার করেননি (যেমন কৃষি সহায়ক AI, যদি আপনি কৃষক না হন) — কোন পদ্ধতিটি বেশি জরুরি হবে, ইন্টারভিউ নাকি কনটেক্সচুয়াল ইনকোয়ারি, এবং কেন?
এমন ক্ষেত্রে কনটেক্সচুয়াল ইনকোয়ারি বিশেষভাবে জরুরি, কারণ গবেষকের নিজের অভিজ্ঞতা বা অনুমান দিয়ে প্রশ্নগুলো তৈরি করা কঠিন — তিনি জানেন না কী জিজ্ঞাসা করা উচিত। ব্যবহারকারীর নিজের পরিবেশে গিয়ে পর্যবেক্ষণ করলে এমন প্রেক্ষাপট-নির্দিষ্ট চাহিদা ও বাধা ধরা পড়ে যা আগে থেকে ধারণাই করা যেত না — যেমন নেটওয়ার্ক-সীমাবদ্ধ এলাকায় অফলাইন কাজ করার প্রয়োজনীয়তা।
অনুশীলন
-
চিন্তা করুন: উপরের কোড সেলে যদি মেডিকেল ফিচারের রেটিংগুলোর একটি ৪-এ পরিবর্তন করা হয়
(যেমন একজন ব্যবহারকারী বেশি সহনশীল), তাহলে গড় কি ডেভেলপারের অনুমান ৩.০-এর কাছাকাছি চলে আসবে বলে আপনার
ধারণা?
একটি মাত্র মান বাড়ালে গড় সামান্য বাড়বে, কিন্তু ১০টি রেটিংয়ের একটি বদলালে খুব বেশি প্রভাব পড়বে না — বাকি ৯টি রেটিং এখনও নিচের দিকে (১-২)। এটা একটি গুরুত্বপূর্ণ পয়েন্ট দেখায়: একটি বহিরাগত (outlier) মতামত পুরো গড়কে বদলে দেয় না, তাই ডিজাইন সিদ্ধান্ত একজনের মতামতের উপর ভিত্তি করে না করে পুরো ডিস্ট্রিবিউশন দেখে নেওয়া উচিত।
-
পরীক্ষা করুন: উপরের কোড সেলে মেডিকেল ফিচারের তালিকার প্রথম মান
1-কে4-এ পরিবর্তন করে (অর্থাৎ[4, 2, 1, 1, 2, 1, 1, 2, 1, 1]) Run চেপে আপনার অনুমান যাচাই করুন।নতুন গড় হয় ১.৬ (আগে ছিল ১.৩) — সামান্য বেড়েছে কিন্তু এখনও ডেভেলপারের অনুমান ৩.০ থেকে অনেক দূরে (পার্থক্য -১.৪)। এটাই প্রমাণ করে একজনের মতামত পুরো প্যাটার্ন বদলাতে পারে না — সিদ্ধান্ত নিতে হয় পর্যাপ্ত নমুনার সামগ্রিক প্রবণতা দেখে।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ ট্রাস্ট ক্যালিব্রেশন, এক্সপ্লেইনেবিলিটি, হিউম্যান-ইন-দ্য-লুপ ডিজাইন, কগনিটিভ লোড, অ্যাক্সেসিবিলিটি, হিউম্যান-AI টিমিং, ইউজেবিলিটি ইভালুয়েশন, ইন্ডাস্ট্রি ফ্রেমওয়ার্ক ও ক্যাপস্টোন।
- AI Ethics কোর্স সহোদর কোর্স নৈতিক ফ্রেমওয়ার্ক, বায়াস-ফেয়ারনেস, প্রাইভেসি ও AI অ্যালাইনমেন্টের গভীর কভারেজ — ইউজার রিসার্চ থেকে বের হওয়া ভালনারেবিলিটি ইস্যুর নৈতিক দিক সেখানে বিস্তারিত।
- সব Courses দেখুন ABCL TECH C, C++, Python, Java, JavaScript, DSA, Machine Learning, Deep Learning, System Design, Cybersecurity, Cloud Computing & DevOps, এবং আরও অনেক কোর্স — সব এক জায়গায়।