ট্রাস্ট, স্যাটিসফ্যাকশন ও পার্সিভড কন্ট্রোল পরিমাপ
এই পাঠে যা শিখবেন
- কেন ট্রাস্ট, স্যাটিসফ্যাকশন ও পার্সিভড কন্ট্রোল টাস্ক-সাকসেসের বাইরে আলাদাভাবে মাপা দরকার
- System Usability Scale (SUS)-এর প্রকৃত ১০-আইটেম কাঠামো ও স্কোরিং ফর্মুলা
- Python দিয়ে একাধিক অংশগ্রহণকারীর SUS স্কোর সঠিকভাবে গণনা করা
- ট্রাস্ট ও পার্সিভড কন্ট্রোল মাপার জন্য ব্যবহৃত সাধারণ, প্রচলিত পদ্ধতি
১ · কেন এগুলো আলাদাভাবে মাপা দরকার
L39-এ আমরা দেখেছি টাস্ক-সাকসেস রেট ও টাইম-অন-টাস্ক কীভাবে মাপা যায় — কিন্তু একজন ব্যবহারকারী একটি টাস্ক সফলভাবে শেষ করেও AI সিস্টেমটির উপর বিরক্ত, অবিশ্বাসী, বা নিয়ন্ত্রণহীন বোধ করতে পারেন। এই তিনটি ধারণা — ট্রাস্ট, স্যাটিসফ্যাকশন, ও পার্সিভড কন্ট্রোল — একে অপরের থেকে আলাদা এবং প্রতিটি ভিন্ন ডিজাইন সমস্যার সংকেত দেয়:
ব্যবহারকারী কি বিশ্বাস করেন সিস্টেমটি তার প্রকৃত সক্ষমতার সাথে সামঞ্জস্যপূর্ণভাবে কাজ করবে? (M3-এ বিস্তারিত)
ব্যবহারকারী কি সামগ্রিক অভিজ্ঞতা নিয়ে সন্তুষ্ট? এটি ট্রাস্টের চেয়ে বিস্তৃত — ইন্টারফেসের গতি, ভাষা, সৌন্দর্যও এতে প্রভাব ফেলে।
ব্যবহারকারী কি মনে করেন প্রয়োজনে তিনি সিস্টেমের সিদ্ধান্ত ওভাররাইড বা সংশোধন করতে পারবেন? (M5, L23-এ বিস্তারিত)
একটি ফিচার উচ্চ টাস্ক-সাকসেস রেট পেলেও নিম্ন পার্সিভড কন্ট্রোল স্কোর পেতে পারে — যেমন একটি অটো-করেকশন ফিচার যা প্রায়ই সঠিক কাজ করে, কিন্তু ব্যবহারকারী অনুভব করেন তিনি এটি নিয়ন্ত্রণ করতে পারছেন না। এই দুই সংকেত একসাথে না দেখলে এই সমস্যাটি ধরাই পড়বে না।
২ · System Usability Scale (SUS) ও এর প্রকৃত স্কোরিং ফর্মুলা
System Usability Scale (SUS)System Usability Scaleএকটি প্রতিষ্ঠিত, ১০-প্রশ্নের স্ট্যান্ডার্ড ইউজেবিলিটি প্রশ্নমালা, যেখানে প্রতিটি প্রশ্নের উত্তর ১-৫ স্কেলে দেওয়া হয় এবং একটি নির্দিষ্ট ফর্মুলা দিয়ে ০-১০০ স্কেলের একক স্কোরে রূপান্তর করা হয়। একটি দশকের-পর-দশক ব্যবহৃত, স্ট্যান্ডার্ড ১০-প্রশ্নের প্রশ্নমালা, যেখানে প্রতিটি প্রশ্নের উত্তর ১ (দৃঢ়ভাবে দ্বিমত) থেকে ৫ (দৃঢ়ভাবে একমত) স্কেলে দেওয়া হয়। প্রশ্নগুলো পর্যায়ক্রমে ইতিবাচক ও নেতিবাচকভাবে লেখা থাকে (যেমন "আমি মনে করি সিস্টেমটি ব্যবহার করা সহজ" বনাম "আমি মনে করি সিস্টেমটি অপ্রয়োজনীয়ভাবে জটিল"), তাই স্কোর করার নিয়মও আইটেম-নম্বর অনুযায়ী বদলায়:
- বিজোড়-নম্বর আইটেম (১, ৩, ৫, ৭, ৯) — ইতিবাচকভাবে লেখা, তাই কন্ট্রিবিউশন = (স্কোর − ১)
- জোড়-নম্বর আইটেম (২, ৪, ৬, ৮, ১০) — নেতিবাচকভাবে লেখা, তাই কন্ট্রিবিউশন = (৫ − স্কোর)
- সব ১০টি কন্ট্রিবিউশনের যোগফল (সর্বোচ্চ সম্ভাব্য ৪০) কে ২.৫ দিয়ে গুণ করলে পাওয়া যায় চূড়ান্ত স্কোর, যা ০ থেকে ১০০ স্কেলে থাকে।
৩ · সত্যিকারের ডেমো — একাধিক অংশগ্রহণকারীর SUS স্কোর গণনা
ধরা যাক তিনজন অংশগ্রহণকারী একটি AI-ভিত্তিক ডকুমেন্ট-সামারাইজার ফিচার ব্যবহারের পর SUS প্রশ্নমালা পূরণ করেছেন। নিচের কোডে উপরের সঠিক ফর্মুলা ব্যবহার করে প্রতিজনের স্কোর এবং গড় স্কোর গণনা করা হয়েছে।
def sus_score(responses):
"""
responses: আইটেম ১ থেকে ১০ ক্রমে ১০টি Likert (১-৫) স্কোরের লিস্ট।
বিজোড় আইটেম (১,৩,৫,৭,৯): কন্ট্রিবিউশন = স্কোর - ১
জোড় আইটেম (২,৪,৬,৮,১০): কন্ট্রিবিউশন = ৫ - স্কোর
সব কন্ট্রিবিউশনের যোগফল * ২.৫ = ০-১০০ স্কেলের SUS স্কোর
"""
total = 0
for i, score in enumerate(responses, start=1):
if i % 2 == 1:
total += (score - 1)
else:
total += (5 - score)
return total * 2.5
# প্রতিটি লিস্টে আইটেম ১..১০-এর জন্য একজন অংশগ্রহণকারীর প্রকৃত Likert উত্তর
participants = {
"P1": [4, 2, 5, 1, 4, 2, 5, 1, 4, 2],
"P2": [3, 3, 4, 2, 3, 3, 4, 2, 3, 3],
"P3": [5, 1, 5, 1, 5, 1, 5, 1, 5, 1],
}
scores = {}
for name, responses in participants.items():
scores[name] = sus_score(responses)
print(f"{name}-এর SUS স্কোর: {scores[name]:.1f}")
mean_sus = sum(scores.values()) / len(scores)
print(f"\nতিনজনের গড় SUS স্কোর: {mean_sus:.2f}")
৪ · ট্রাস্ট ও পার্সিভড কন্ট্রোল মাপার অন্যান্য পদ্ধতি
SUS মূলত সাধারণ ইউজেবিলিটি মাপে — ট্রাস্ট বা পার্সিভড কন্ট্রোল নির্দিষ্টভাবে মাপার জন্য গবেষকরা প্রায়ই নিজস্ব সংক্ষিপ্ত Likert-স্কেল প্রশ্নমালা তৈরি করেন, যেমন:
- ট্রাস্ট আইটেম — "আমি এই সিস্টেমের পরামর্শের উপর নির্ভর করতে স্বাচ্ছন্দ্য বোধ করি"-এর মতো কয়েকটি বিবৃতিতে ১-৫ বা ১-৭ স্কেলে একমত/দ্বিমত জানানো, তারপর গড় নেওয়া।
- পার্সিভড কন্ট্রোল আইটেম — "আমি যখন চাই তখন সিস্টেমের সিদ্ধান্ত পরিবর্তন বা বাতিল করতে পারি"-জাতীয় বিবৃতির প্রতিক্রিয়া।
- গুণগত ইন্টারভিউ — সংখ্যার পাশাপাশি "কখন আপনি সিস্টেমটির উপর সবচেয়ে কম বিশ্বাস করেছিলেন?" জাতীয় খোলা প্রশ্ন প্রায়ই সংখ্যার পেছনের কারণ বুঝতে সাহায্য করে।
SUS-এর মতো একটি স্ট্যান্ডার্ড, সঠিকভাবে-গণনাকৃত স্কোর আপনাকে সময়ের সাথে বা ফিচারের মধ্যে তুলনা করার একটি নির্ভরযোগ্য সংখ্যা দেয় — কিন্তু একটি একক গড় সংখ্যা (৮১.৬৭) ব্যক্তি-পর্যায়ের তারতম্য (P2-এর ৬০.০) লুকিয়ে ফেলতে পারে। তাই ব্যক্তি-পর্যায়ের স্কোর, গড় এবং গুণগত ফিডব্যাক — তিনটেই একসাথে দেখা দরকার। পরের পাঠে (L43) আমরা দেখব এই একই মেট্রিকগুলো একবার নয়, বরং সময়ের সাথে বারবার মাপলে কী নতুন তথ্য পাওয়া যায়।
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ SUS প্রশ্নমালায় ইতিবাচক ও নেতিবাচক আইটেম পর্যায়ক্রমে (alternating) রাখা হয় কেন? এটি বাদ দিলে কী সমস্যা হতে পারে?
পর্যায়ক্রমে রাখা হয় "অ্যাকুইসেন্স বায়াস" (acquiescence bias) কমানোর জন্য — কিছু অংশগ্রহণকারী চিন্তা না করেই সব প্রশ্নে "একমত" (উচ্চ স্কোর) দিতে থাকেন। ইতিবাচক-নেতিবাচক পর্যায়ক্রম থাকলে অসাবধান উত্তরদাতাদের অসামঞ্জস্যপূর্ণ উত্তর ধরা পড়ে, এবং প্রতিটি আইটেম পড়ে বুঝে উত্তর দিতে বাধ্য করে।
প্র ০২ উপরের ডেমোতে P3 পেয়েছেন সর্বোচ্চ সম্ভাব্য স্কোর ১০০। এই একটি সংখ্যা কি তার নিজে থেকেই যথেষ্ট তথ্য দেয়?
একা এই সংখ্যাটি বলে না P3 কেন এত সন্তুষ্ট — হয়তো তিনি খুব সাধারণ, কম-চাহিদাসম্পন্ন একটি টাস্ক করেছিলেন, বা হয়তো ফিচারটি সত্যিই চমৎকার কাজ করেছে। এছাড়া মাত্র একজনের ১০০ স্কোর সামগ্রিক ফলাফল সম্পর্কে কিছু বলে না — সেজন্যই গড় স্কোর ও প্রতিজনের স্কোর একসাথে দেখা এবং যথেষ্ট বড় নমুনা রাখা জরুরি।
প্র ০৩ একটি ফিচার উচ্চ SUS স্কোর পেলেও নিম্ন ট্রাস্ট স্কোর পেতে পারে কীভাবে — একটি বাস্তবসম্মত উদাহরণ চিন্তা করুন।
একটি AI চ্যাটবট হয়তো ব্যবহার করতে খুব সহজ ও দ্রুত (উচ্চ SUS), কিন্তু ব্যবহারকারী জানেন এটি মাঝেমধ্যে ভুল তথ্য দেয় এবং কখন সেটা হচ্ছে তা বুঝতে পারেন না — ফলে তারা এর উত্তরের উপর নির্ভরযোগ্যভাবে ভরসা করতে পারেন না (নিম্ন ট্রাস্ট)। "ব্যবহার করা সহজ" আর "নির্ভরযোগ্য মনে হয়" — এই দুটো সম্পূর্ণ আলাদা প্রশ্ন, যা M3-এ বিস্তারিত আলোচনা করা হয়েছে।
অনুশীলন
-
চিন্তা করুন: যদি একজন চতুর্থ অংশগ্রহণকারী (P4) প্রতিটি প্রশ্নে ঠিক মাঝামাঝি স্কোর (৩)
দেন, তাহলে তার SUS স্কোর কত হবে বলে আপনার ধারণা?
প্রতিটি বিজোড় আইটেমে কন্ট্রিবিউশন হবে (৩−১)=২, প্রতিটি জোড় আইটেমে (৫−৩)=২ — অর্থাৎ প্রতিটি আইটেমেই কন্ট্রিবিউশন সমান (২)। মোট ১০ × ২ = ২০, স্কোর = ২০ × ২.৫ = ৫০। তাই অনুমান করা যায় স্কোরটি স্কেলের ঠিক মাঝামাঝি (৫০) হবে — এটি একটি ভালো স্যানিটি-চেক যে ফর্মুলাটি প্রত্যাশিতভাবেই কাজ করছে।
-
যাচাই করুন: উপরের কোডে
participantsডিকশনারিতে"P4": [3, 3, 3, 3, 3, 3, 3, 3, 3, 3]যোগ করে Run চেপে আপনার অনুমান যাচাই করুন।হ্যাঁ, P4-এর স্কোর ঠিক ৫০.০ আসে, যা অনুমান নিশ্চিত করে। চারজনের নতুন গড় স্কোর হয় (৮৫+৬০+১০০+৫০)/৪ = ৭৩.৭৫ — P4 যোগ হওয়ায় গড় স্কোর ৮১.৬৭ থেকে কমে গেছে, কারণ P4-এর "মাঝামাঝি" মতামত আগের গড়ের চেয়ে কম।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- লংগিচুডিনাল ইভালুয়েশন — সময়ের সাথে ট্রাস্ট ও ব্যবহারের পরিবর্তন পরবর্তী পাঠ একবার মাপা SUS বা ট্রাস্ট স্কোরের বদলে সময়ের সাথে বারবার মাপলে কী দেখা যায়।
- উইজার্ড-অফ-ওজ ও প্রোটোটাইপিং টেকনিক আগের পাঠ প্রকৃত মডেল বানানোর আগেই ইন্টারঅ্যাকশন ডিজাইন যাচাই করার পদ্ধতি।
- কোর্সের সম্পূর্ণ সিলেবাস দেখুন ৫৭টি পাঠ ট্রাস্ট ক্যালিব্রেশন, এক্সপ্লেইনেবিলিটি, হিউম্যান-ইন-দ্য-লুপ ডিজাইন, ইভালুয়েশন পদ্ধতি ও ইন্ডাস্ট্রি ফ্রেমওয়ার্ক — সব একসাথে।