AI সমস্যার ধরন — শ্রেণিবিভাগ
এই পাঠে যা শিখবেন
- AI সমস্যাগুলো কত প্রধান ধরনে ভাগ হয় — এবং কীভাবে চিনবেন
- প্রতিটি সমস্যার ধরনের জন্য বাস্তব উদাহরণ
- একটি বাস্তব সমস্যাকে AI-এর ভাষায় কীভাবে রূপান্তর করবেন
১ · কেন এই শ্রেণিবিভাগ গুরুত্বপূর্ণ?
বাস্তব জীবনে আপনি অনেক ধরনের সমস্যা শুনবেন — "ই-মেইল spam কি না বলো", "বাড়ির দাম কত হবে অনুমান করো", "এই ছবিতে কী আছে শনাক্ত করো"। প্রতিটি দেখতে ভিন্ন। কিন্তু AI-এর চোখে এগুলো মাত্র কয়েকটি মৌলিক ধরনে পড়ে।
Classification, Regression, Clustering, Ranking, Generation, Reinforcement Learning
আপনি যদি একটি সমস্যাকে এই শ্রেণিতে ফেলতে পারেন — তবে কোন অ্যালগরিদম বেছে নেবেন তা প্রায় ঠিক হয়ে যায়।
২ · Classification — শ্রেণিবিভাগ
প্রশ্নের ধরন: "এটা কোন শ্রেণির?" — উত্তর হবে কিছু সীমিত শ্রেণির একটি। এটি একটি supervised learningSupervised Learningমডেলকে আগে থেকে labeled ডেটা দেওয়া হয় — প্রতিটি ইনপুটের সঠিক উত্তরসহ। মডেল input → output mapping শিখে। Classification ও Regression — দু'টিই supervised. বিপরীতে Clustering unsupervised — কোনো লেবেল ছাড়া। সমস্যা।
উদাহরণ
- এই ই-মেইলটি spamSpamঅযাচিত বা বাল্ক ই-মেইল/বার্তা — সাধারণত বিজ্ঞাপন, প্রতারণা বা ফিশিং। AI spam filter শিখে নেয় কোন শব্দ/প্যাটার্ন spam নির্দেশ করে। কি spam নয়? (২ শ্রেণি — Binary classificationBinary Classificationমাত্র দুটি শ্রেণির মধ্যে এক বেছে নেওয়া — হ্যাঁ/না, spam/not-spam, fraud/legit. সবচেয়ে সরল classification সমস্যা।)
- এই ছবিতে কুকুর, বিড়াল, না পাখি? (৩ শ্রেণি — Multi-class)
- এই বাংলা পোস্টটির মেজাজ কেমন — খুশি, দুঃখী, রাগী, নিরপেক্ষ? (Sentiment classificationSentiment Classificationএকটি লেখা বা বার্তার আবেগ/মেজাজ চেনা — positive, negative, neutral. পণ্যের রিভিউ, সোশ্যাল মিডিয়া বিশ্লেষণ, গ্রাহক ফিডব্যাকে বহুল ব্যবহৃত।)
- এই ব্যাংক লেনদেন প্রতারণা কি না?
- এক্স-রে দেখে রোগ নির্ণয় — TB, COVID, না সুস্থ?
৩ · Regression — সংখ্যার পূর্বাভাস
প্রশ্নের ধরন: "কত হবে?" — উত্তর হবে একটি সংখ্যা (continuous valueContinuous Valueযেকোনো বাস্তব সংখ্যা — দাম, তাপমাত্রা, ওজন, সময়। বিপরীতে discrete value কেবল নির্দিষ্ট কয়েকটি মান নেয় (যেমন শ্রেণি ০/১/২)।)।
উদাহরণ
- ঢাকার একটি ৩-বেডরুম ফ্ল্যাটের দাম কত হবে?
- আগামীকাল ঢাকায় তাপমাত্রা কত হবে?
- এই গ্রাহক আগামী মাসে কত টাকা খরচ করবে?
- একটি নতুন ওষুধ কত শতাংশ কার্যকর হবে?
৪ · Clustering — গোষ্ঠীকরণ
প্রশ্নের ধরন: "এই অজানা ডেটা কীভাবে দল করা যায়?" — উত্তর: কিছু গোষ্ঠী।
Classification ও Regression-এ আগে থেকে লেবেল করা ডেটা থাকে (supervised)। Clustering-এ লেবেল নেই — ডেটাকে নিজে নিজে দল করতে হয় (unsupervisedUnsupervised Learningমডেলকে কেবল raw ডেটা দেওয়া হয় — কোনো লেবেল বা সঠিক উত্তর নেই। মডেল ডেটার ভেতরের কাঠামো নিজে আবিষ্কার করে। Clustering (K-Means, DBSCAN), Dimensionality Reduction (PCA, t-SNE), Anomaly Detection — সবই unsupervised. লেবেল করা ব্যয়সাপেক্ষ — তাই বাস্তবে unsupervised methods গুরুত্বপূর্ণ।)।
উদাহরণ
- একটি ই-কমার্স সাইটের সব গ্রাহককে কেনাকাটার অভ্যাস অনুসারে দল করুন
- সংবাদ-নিবন্ধগুলোকে স্বয়ংক্রিয়ভাবে বিষয়ভিত্তিক গ্রুপ করুন
- একটি জিন ডেটাবেসে অনুরূপ জিনগুলো একসাথে রাখুন
- বাংলাদেশের জেলাগুলোকে অর্থনৈতিক বৈশিষ্ট্য অনুসারে গোষ্ঠী করুন
৫ · Ranking — ক্রম তৈরি
প্রশ্নের ধরন: "এই বস্তুগুলোর সঠিক ক্রম কী?" — উত্তর হবে একটি অর্ডার।
উদাহরণ
- Google সার্চ-এ কোন ১০টি ওয়েবসাইট প্রথমে দেখানো হবে?
- YouTube-এ আপনাকে কোন ভিডিও আগে সাজেস্ট হবে?
- Daraz-এ একটি পণ্য সার্চ করলে কোনটি আগে দেখাবে?
- Spotify-এ কোন গান আপনার "Discover Weekly"-তে যাবে?
৬ · Generation — কিছু তৈরি করা
প্রশ্নের ধরন: "নতুন কিছু তৈরি করো" — উত্তর হবে নতুন কনটেন্ট।
এটাই আজকের Generative AIGenerative AIযে AI নতুন কনটেন্ট তৈরি করে — লেখা, ছবি, কোড, অডিও, ভিডিও। ChatGPT, Midjourney, DALL-E এই শ্রেণির। ২০২২ সালের পর এর বিস্ফোরণ ঘটেছে।। এর মধ্যে পড়ে —
টেক্সট জেনারেশন
- ChatGPT-এর মতো একটি প্রশ্নের উত্তর লেখা
- একটি সারাংশ তৈরি করা
- বাংলা থেকে ইংরেজি অনুবাদ
- কোড লেখা (GitHub Copilot)
ছবি জেনারেশন
- একটি লেখা থেকে ছবি বানানো (Stable Diffusion, DALL-E)
- একটি ছবিকে অন্য ভঙ্গিতে রূপান্তর
- পুরোনো সাদা-কালো ছবিতে রং দেওয়া
অডিও/ভিডিও
- লেখা থেকে কণ্ঠ — Text-to-Speech
- একটি কণ্ঠের অনুকরণ
- ভিডিও তৈরি (Sora, Runway)
৭ · Reinforcement Learning — শিখে শিখে কাজ করা
প্রশ্নের ধরন: "এই পরিবেশে দীর্ঘমেয়াদে সর্বোচ্চ পুরস্কার পেতে কী করব?"
RL-এ একটি agentAgentRL-এ যে কাজ/সিদ্ধান্ত নেয় — সে-ই agent. যেমন দাবা খেলোয়াড় বট, স্ব-চালিত গাড়ির AI, রোবট। আজ "AI agent" বলতে সাধারণত বোঝায় LLM-চালিত স্বয়ংক্রিয় সহকারী। থাকে, যে একটি environmentEnvironmentযে পরিবেশে agent কাজ করে — দাবার বোর্ড, রাস্তা, গেমের জগৎ। agent action নেয়, environment নতুন state ও reward ফিরিয়ে দেয়।-এ কাজ করে। প্রতিটি কাজের জন্য সে rewardRewardagent-কে দেওয়া সংখ্যাসূচক feedback — ভাল কাজে ধনাত্মক, খারাপ কাজে ঋণাত্মক। RL-এর মূল লক্ষ্য — দীর্ঘমেয়াদে cumulative reward সর্বোচ্চ করা। বা penalty পায়। সময়ের সাথে সে শেখে — কোন ক্রমে কাজ করলে সর্বোচ্চ পুরস্কার মেলে।
উদাহরণ
- AlphaGoAlphaGoDeepMind-এর তৈরি RL-ভিত্তিক প্রোগ্রাম যা ২০১৬ সালে বিশ্ব Go চ্যাম্পিয়ন Lee Sedol-কে হারায় — AI ইতিহাসে এক ঐতিহাসিক মুহূর্ত। RL-এর শক্তি প্রদর্শনের সবচেয়ে বিখ্যাত উদাহরণ। দাবা/Go খেলে — জিতলে +১, হারলে −১
- স্ব-চালিত গাড়ি — নিরাপদে গন্তব্যে পৌঁছালে পুরস্কার
- একটি রোবট হাঁটতে শেখা
- ChatGPT-এর RLHFRLHF (Reinforcement Learning from Human Feedback)মানুষ একই প্রশ্নের একাধিক উত্তর rank করেন; সেই rank থেকে একটি reward model শেখে; তারপর সেই reward দিয়ে base LLM-কে fine-tune করা হয়। OpenAI এই পদ্ধতি ChatGPT-তে এনে LLM-কে "সহায়ক" বানায় (২০২২)। আজ Claude, Gemini সবাই এই পদ্ধতি ব্যবহার করে। — মানুষের প্রতিক্রিয়া থেকে আরও ভালো উত্তর শেখা
- স্টক ট্রেডিং বট
৮ · বাস্তব সমস্যাকে AI-ভাষায় রূপান্তর — উদাহরণ
একটি সমস্যা: "আমি একটি বাংলা সংবাদপত্রের অনলাইন সংস্করণের মালিক। পাঠক বাড়াতে চাই।" এটা একটি ব্যবসায়িক সমস্যা — AI-ভাষায় কী কী হবে?
একই সমস্যা থেকে অনেক AI-উপ-সমস্যা
- Recommendation (Ranking): প্রতিটি পাঠকের জন্য কোন নিবন্ধ আগে দেখাব?
- Classification: এই পাঠক কোন বিষয়ে আগ্রহী — খেলা, রাজনীতি, বিনোদন?
- Generation: প্রতিটি নিবন্ধের ১০০-শব্দের সারাংশ তৈরি করো
- Regression: এই নিবন্ধটি কত পাঠক পড়বে?
- Clustering: পাঠকদের আগ্রহ অনুসারে দল করো
৯ · একটি দ্রুত নির্ণায়ক
সমস্যা পেলে নিজেকে এই প্রশ্ন করুন —
- উত্তর কি একটি লেবেল? → Classification
- উত্তর কি একটি সংখ্যা? → Regression
- লেবেল নেই, প্যাটার্ন খুঁজছি? → Clustering
- একটি ক্রম দরকার? → Ranking
- নতুন কনটেন্ট দরকার? → Generation
- সিদ্ধান্তের ধারাবাহিকতা দরকার পরিবেশে? → Reinforcement Learning
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ Translation (অনুবাদ) — Classification নাকি Generation? কেন?
চমৎকার প্রশ্ন — এর উত্তরে গত ৩০ বছরের NLP ইতিহাস। সরল উত্তর: আজ Generation. কিন্তু আগে অন্যভাবেও দেখা হতো।
Classification হিসেবে দেখলে: "বাংলা থেকে ইংরেজি — মোট তো সীমিত কিছু সঠিক অনুবাদ আছে।" — কিন্তু সমস্যা হলো শ্রেণির সংখ্যা প্রায় অসীম। প্রতিটি বাক্যের জন্য নতুন "শ্রেণি" — practical না।
Generation হিসেবে দেখলে (আধুনিক দৃষ্টি): অনুবাদ মানে — input sequence থেকে output sequence তৈরি। প্রতিটি token (শব্দ/অংশ) এক এক করে generate হয়।
- ২০১৪-র Google Translate ছিল phrase-based — অনেকটা lookup table-এর মতো।
- ২০১৬-র "Google Neural Machine Translation" — sequence-to-sequence (seq2seq) model. প্রকৃত generation.
- আজকের Translate ও ChatGPT — Transformer-ভিত্তিক generation.
Token-level দৃষ্টিকোণ: ভেতরে প্রতিটি token generation হলো একটি massive multi-class classification — শব্দভাণ্ডারের ৫০,০০০+ টোকেনের মধ্যে কোনটি পরবর্তী হবে। তাই বলা যায় — "Generation = বহু consecutive classifications"। কিন্তু সমস্যার ধরন হিসেবে আমরা একে Generation বলি, কারণ output একটি sequence.
প্র ০২ YouTube Shorts বা TikTok-এর ফিড একই সাথে কীভাবে Ranking, Classification, Regression ও RL — চারটি ধরন একসাথে ব্যবহার করে?
এটি বাস্তব production AI-র সবচেয়ে সুন্দর উদাহরণ। একটি সাধারণ "ফিড" ভেতরে অন্তত ১০-১৫টি মডেলের সমন্বয়। চারটি প্রধান ধরন এভাবে কাজ করে:
(১) Classification — Content understanding:
- প্রতিটি ভিডিও আপলোডের পর — বিষয় শ্রেণিকরণ (সংগীত, রান্না, রাজনীতি)।
- NSFW / hate-speech / spam detection — binary classification.
- ভাষা ও দেশ চিহ্নিতকরণ।
(২) Regression — Engagement prediction:
- "এই ব্যবহারকারী কত সেকেন্ড দেখবে এই ভিডিও?" — সংখ্যা।
- "Like দেওয়ার সম্ভাবনা কত শতাংশ?" — probability (০-১) ⇒ regression.
- "Comment করার সম্ভাবনা?" — আলাদা regression model.
(৩) Ranking — Final ordering:
- হাজারো candidate ভিডিও থেকে শ্রেষ্ঠ ১০টি বাছাই — predicted engagement scores একত্রে weight করে।
- "Diversity" ensure করা — একই ধরনের ভিডিও পরপর না দেখানো।
(৪) Reinforcement Learning — Long-term optimization:
- "আজ একটু কম-জনপ্রিয় ভিডিও দেখালে কাল ব্যবহারকারী ফিরবে?" — দীর্ঘমেয়াদি reward.
- Multi-armed bandit — নতুন ভিডিও exploration vs জনপ্রিয় ভিডিও exploitation.
- YouTube-এর REINFORCE পেপার (২০১৯) এই দিকেই আলো ফেলে।
মূল উপলব্ধি: বাস্তব AI সিস্টেম এক টাইপ নয় — সবগুলোর সংমিশ্রণ। যত ভাল আপনি প্রতিটি টাইপ চিনতে পারেন, তত বড় সিস্টেম ডিজাইন করতে পারবেন।
প্র ০৩ Anomaly Detection — যেমন bKash-এ fraud ধরা — এটা Classification না Clustering? এটি কেন একটু কঠিন প্রশ্ন?
সংক্ষেপে: দু'টি দৃষ্টিভঙ্গিই বৈধ — পরিস্থিতির উপর নির্ভর। এটি আসলে একটি স্বতন্ত্র উপ-ক্ষেত্র।
Classification হিসেবে দেখা যায় যখন:
- ইতিমধ্যে অনেক "fraud" labeled examples আছে।
- সমস্যা: "Fraud দারুণ rare — হয়তো ০.১% লেনদেন।" — ফলে severely imbalanced classification।
- সমাধান: SMOTE oversampling, focal loss, class weights. Precision-Recall AUC দেখি (Accuracy বিভ্রান্তিকর)।
Clustering / Density Estimation হিসেবে দেখা যায় যখন:
- Labeled fraud examples কম বা নেই।
- ধারণা: "স্বাভাবিক" আচরণ একটি ঘন cluster তৈরি করে; যেগুলো cluster থেকে দূরে — সন্দেহজনক।
- পদ্ধতি: Isolation Forest, One-Class SVM, Autoencoder reconstruction error, DBSCAN.
বাস্তব bKash-এর মতো সিস্টেম:
- প্রথম স্তর — unsupervised: অস্বাভাবিক pattern (হঠাৎ বড় amount, নতুন device, রাত ৩টা) flag করে।
- দ্বিতীয় স্তর — supervised classifier: flag হওয়া cases-এ আরও সূক্ষ্ম বিচার।
- তৃতীয় স্তর — মানুষের investigation team final decision.
মূল শিক্ষা: AI-র শ্রেণিবিভাগ "কাঠামো" দেয়, "জেলখানা" নয়। বাস্তবে অনেক সমস্যা একাধিক টাইপের মাঝামাঝি — এবং সেটাই স্বাভাবিক।
প্র ০৪ "একটি বাংলা ই-কমার্স স্টার্টআপ চালু করব" — এই ব্যবসার জন্য কোন কোন AI সমস্যার ধরন কাজে আসবে? প্রতিটির বাংলা-নির্দিষ্ট চ্যালেঞ্জ কী?
একটি ই-কমার্স প্রায় AI-র সব ধরন ছুঁয়ে যায়। বাংলাদেশ-প্রসঙ্গে কিছু বিশেষ চ্যালেঞ্জও আছে।
Classification — কাজে আসবে:
- পণ্যের ছবি থেকে বিভাগ চেনা ("শাড়ি", "মোবাইল")।
- রিভিউ-এর sentiment — বাংলায় negative/positive.
- Fake review detection.
- চ্যালেঞ্জ: বাংলা-ইংরেজি মিশ্রিত ("জটিল laptop")। বানান বৈচিত্র্য। লেবেল করা ডেটার অভাব।
Regression — কাজে আসবে:
- প্রতিটি গ্রাহকের expected lifetime value.
- প্রতিটি পণ্যের সাপ্তাহিক বিক্রয় পূর্বাভাস (inventory-র জন্য)।
- Delivery time estimate ঢাকায় বনাম জেলায়।
- চ্যালেঞ্জ: ঈদ/পূজা-র seasonality খুব তীব্র। ঢাকা-জেলার আচরণ ভিন্ন।
Clustering — কাজে আসবে:
- গ্রাহক segmentation — bargain hunters vs premium.
- গ্রাম/শহরভিত্তিক ক্রয়-প্যাটার্ন।
Ranking — কাজে আসবে:
- সার্চ ফলাফল personalization ("শাড়ি" সার্চ — কোন ১০টি আগে?)।
- হোম পেজে recommendation.
- চ্যালেঞ্জ: বাংলা সার্চ query-র spelling বৈচিত্র্য, transliteration ("shari" vs "শাড়ি")।
Generation — কাজে আসবে:
- পণ্যের বিবরণ স্বয়ংক্রিয় বাংলায় তৈরি।
- গ্রাহকসেবা চ্যাটবট।
- ফেসবুক বিজ্ঞাপনের কপি।
- চ্যালেঞ্জ: বাংলায় quality LLM সীমিত। GPT-4 সাধারণ বাংলায় ভাল, কিন্তু অঞ্চল/ব্যবসায়িক tone দুর্বল।
RL — কাজে আসবে:
- Dynamic pricing — "এখন কত দাম দিলে সর্বোচ্চ লাভ?"
- Inventory replenishment.
বার্তা: ই-কমার্স একটি AI-পূর্ণ ব্যবসা — এমনকি আপনি যদি একটি ছোট স্টার্টআপ হন। শুরু করুন সবচেয়ে সহজ অংশ দিয়ে (Classification + Ranking), পরে বিস্তৃত করুন।
অনুশীলন
-
চিহ্নিত করুন: নিচের প্রতিটি সমস্যা কোন ধরনের?
- একটি ছবিতে কতজন মানুষ আছে গণনা করা
- একটি ছবিতে যা যা আছে সব বস্তু চিহ্নিত করা
- একটি কণ্ঠ থেকে কে কথা বলছে চেনা
- একটি ভিডিও থেকে সংক্ষিপ্ত বিবরণ লেখা
- Daraz-এ "আপনার জন্য পছন্দের" পণ্য সাজানো
- সব Twitter ব্যবহারকারীকে রাজনৈতিক মতাদর্শ অনুসারে দল করা (লেবেল ছাড়াই)
- মানুষ গণনা: Regression (সংখ্যা)। তবে অভ্যন্তরে object detection (Classification + box prediction) ব্যবহৃত হয়।
- সব বস্তু চিহ্নিত: Object Detection — Classification + Localization-এর সংমিশ্রণ। প্রতিটি bounding box-এর জন্য classification.
- কণ্ঠ থেকে speaker চেনা: Classification (multi-class — কতজন speaker সেই অনুযায়ী)। একে বলা হয় Speaker Identification.
- ভিডিও থেকে সংক্ষিপ্ত বিবরণ: Generation (text)। Video → text — multimodal generation.
- Daraz personalization: Ranking. প্রতিটি গ্রাহকের জন্য আলাদা ক্রম।
- রাজনৈতিক দল করা (লেবেল ছাড়াই): Clustering — unsupervised.
-
রূপান্তর করুন: "আমি বাংলাদেশের একটি কৃষি স্টার্টআপ চালাই — কৃষকদের সাহায্য করতে চাই"। এই ব্যবসায়িক সমস্যা থেকে ৪টি AI-উপসমস্যা বের করুন।
আদর্শ ভাঙ্গন:
- Classification: পাতার ছবি থেকে রোগ চেনা — "blight", "rust", "সুস্থ" (multi-class)।
- Regression: আবহাওয়া + মাটির তথ্য থেকে এই মৌসুমে ফলন কত হবে অনুমান।
- Ranking: কৃষককে কোন বীজ/সার সবচেয়ে উপযুক্ত — তার জমির বৈশিষ্ট্য অনুসারে সাজানো।
- Generation: বাংলায় চ্যাটবট — "ধানে পচন কেন হচ্ছে?" এর উত্তর তৈরি।
- Clustering: একই অঞ্চলের কৃষকদের ফসল-ধরন অনুসারে দল করে যৌথ পরামর্শ।
- Forecasting (Regression-এর বিশেষ ধরন): বাজারে এই ফসলের দাম পরের সপ্তাহে কত হবে।
মূল কথা: একটি ছাতার নিচে ৫-৬টি মডেল — প্রতিটি স্পষ্ট AI-টাইপে ফিট। এটাই বাস্তব AI প্রকৌশল।
-
চিন্তা করুন: Translation (অনুবাদ) — Classification নাকি Generation? কেন?
উত্তর: Generation. Output একটি sequence — শ্রেণি নয়। Sentence-এর সম্ভাব্য রূপ অসীম, তাই Classification-এর মতো সীমিত শ্রেণি বানানো অসম্ভব।
তবে অভ্যন্তরীণভাবে — প্রতিটি token (শব্দ/sub-word) generate করার মুহূর্তে — এটি একটি massive multi-class classification (শব্দভাণ্ডারের ৫০,০০০+ tokens-এর মধ্যে কোনটি পরবর্তী?)। সুতরাং বলা যায় — "Generation = বহু consecutive classifications"।
বাস্তব আধুনিক অনুবাদ Transformer ভিত্তিক sequence-to-sequence — যেমন Google NMT (২০১৬), Meta-র NLLB (২০২২)।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- পাঠ ০৭ · বাস্তব জীবনে AI কোথায় পরবর্তী পাঠ আজকের AI কোথায় কাজ করছে — স্বাস্থ্য, কৃষি, যোগাযোগ, সরকারি সেবায়।
- পাঠ ০৫ · AI vs ML vs DL আগের পাঠ এই ৬ ধরনের সমস্যা সমাধানে ML বনাম DL — কোনটিকে কোথায় মেলায়।
- পাঠ ২৮ · Metrics এই পাঠের সাথে সম্পর্কিত Classification → Accuracy/F1, Regression → MSE, Ranking → NDCG — প্রতিটি ধরনের জন্য আলাদা metric.
- পাঠ ২৭ · Datasets এই পাঠের সাথে সম্পর্কিত Supervised vs unsupervised — ডেটাসেট কেমন লাগে কোন সমস্যায়।
- সব AI Courses দেখুন ABCL TECH Python, ML, DL, NLP, CV, GenAI, RL, MLOps — সব AI কোর্স একসাথে।