পাঠ ০৫ · ৩০-এর মধ্যে
Home / AI Courses / AI Foundations / AI vs ML vs DL

AI বনাম ML বনাম Deep Learning

AI vs Machine Learning vs Deep Learning — the landscape
৭ মিনিট পড়া শুরু · Beginner সম্পূর্ণ বাংলায়

এই পাঠে যা শিখবেন

  • AI, ML, DL — তিনটি শব্দের সম্পর্ক ও পার্থক্য পরিষ্কার বুঝবেন
  • প্রতিটির বাস্তব উদাহরণ চিনবেন
  • "Feature engineering" কী, কেন DL এসে এটাকে অপ্রয়োজনীয় করে দিল
  • একটি সমস্যার জন্য কোন পদ্ধতি বাছবেন — সিদ্ধান্ত নেওয়ার নিয়ম

১ · তিনটি শব্দ, একটি সম্পর্ক

খবর-কাগজে AI, Machine Learning ও Deep Learning — শব্দ তিনটি প্রায়ই একই অর্থে ব্যবহার করা হয়। কিন্তু এগুলোর মধ্যে স্পষ্ট সম্পর্ক আছে — একটি অন্যটির ভেতরে।

সম্পর্ক

AI বৃহত্তম বৃত্ত। ML AI-এর ভিতরে একটি ছোট বৃত্ত। DL ML-এর ভিতরে আরও ছোট বৃত্ত।
DL ⊂ ML ⊂ AI

চলুন একে একে দেখি।

২ · AI — সবচেয়ে বড় বৃত্ত

যেকোনো সিস্টেম যা মানুষের বুদ্ধিমত্তার অনুকরণ করার চেষ্টা করে — তা AI. এতে অনেক পদ্ধতি থাকতে পারে —

  • নিয়মভিত্তিক সিস্টেম (Symbolic AI)
  • সার্চ অ্যালগরিদম (যেমন দাবা প্রোগ্রাম)
  • লজিক ও যুক্তি-প্রমাণ সিস্টেম
  • Machine Learning
  • Deep Learning

সবগুলোই AI. কিন্তু সব AI ML নয়।

AI হলো "বুদ্ধিমান যন্ত্র বানানোর সমগ্র উদ্যোগ" — এর ভিতরে অনেক পথ। ১৯৫০-৭০-এর বেশিরভাগ AI ছিল নিয়মভিত্তিক — কোনো শেখাই ছিল না। Deep BlueDeep Blue (১৯৯৭)IBM-এর তৈরি দাবা-কম্পিউটার — ১৯৯৭ সালে বিশ্বচ্যাম্পিয়ন Garry Kasparov-কে হারায়। কিন্তু এটি ML ছিল না — সম্পূর্ণ hand-coded heuristics ও brute-force search. "AI কিন্তু ML নয়" এর সেরা উদাহরণ। (১৯৯৭) যে দাবায় Kasparov-কে হারাল — সেটিও ML ছিল না, বিশাল search ও hand-coded heuristics.

৩ · ML — যে AI ডেটা থেকে শেখে

সংজ্ঞা

Machine Learning হলো AI-এর একটি উপশাখা — যেখানে যন্ত্রকে স্পষ্টভাবে প্রোগ্রাম না করে ডেটা থেকে নিজে শিখতে দেওয়া হয়।

Tom Mitchell-এর সংজ্ঞা (১৯৯৭)Tom MitchellCarnegie Mellon University-র অধ্যাপক, ML-এর pioneer. তাঁর ১৯৯৭-এর বই "Machine Learning" দশকের পর দশক ধরে ML-এর প্রথম পাঠ্যবই। T-E-P সংজ্ঞাটি আজও ML-এর সবচেয়ে নির্ভুল formal সংজ্ঞা।: একটি কম্পিউটার প্রোগ্রাম একটি কাজ T-এ অভিজ্ঞতা E থেকে শেখে যদি পরিমাপ P-এ তার পারফরম্যান্স অভিজ্ঞতা E-এর সাথে উন্নত হয়।

ভাবুন একটি স্প্যাম ফিল্টার। আপনি যখন একটি ই-মেইল "Spam" হিসেবে চিহ্নিত করেন — সিস্টেম শেখে। পরের বার একই ধরনের ই-মেইল এলে নিজেই spam হিসেবে চিনতে পারবে। কেউ "spam-এর নিয়ম" লিখে দেয়নি — সে নিজেই উদাহরণ থেকে শিখেছে।

ML-এর কয়েকটি ক্লাসিক পদ্ধতি

  • Linear RegressionLinear Regressionসবচেয়ে সরল ML অ্যালগরিদম — input ও output-এর মধ্যে একটি সরলরেখার সম্পর্ক ফিট করে। যেমন: বাড়ির আয়তন থেকে দামের পূর্বাভাস। সব ML কোর্সের প্রথম পাঠ।: সংখ্যার পূর্বাভাস (যেমন বাড়ির দাম)
  • Decision TreesDecision Tree"যদি-তাহলে" প্রশ্নের গাছ। প্রতিটি নোডে একটি প্রশ্ন (যেমন "বয়স > ৩০?"), উত্তরের ভিত্তিতে শাখা ভাগ হয়। মানুষ পড়তে পারে — তাই ব্যাখ্যাযোগ্য।: "যদি-তাহলে" প্রশ্নের গাছ
  • Random ForestRandom Forestশত শত Decision Tree-র সম্মিলিত উত্তর — গণতান্ত্রিক ভোটের মতো। একক Tree-র চেয়ে অনেক বেশি নির্ভুল। Tabular ডেটার অন্যতম জনপ্রিয় ML মডেল।: অনেক Decision Tree একসাথে
  • SVM (Support Vector Machine)SVM · Support Vector Machineদুই শ্রেণির ডেটা পয়েন্টের মাঝে সর্বাধিক ব্যবধান (margin) তৈরি করে এমন রেখা/সমতল খুঁজে বের করে। DL-এর আগে text classification-এর সেরা পদ্ধতি ছিল।: দুই শ্রেণিকে আলাদা করার সর্বোত্তম রেখা
  • K-MeansK-Meansসবচেয়ে জনপ্রিয় unsupervised clustering অ্যালগরিদম — ডেটাকে K-টি গ্রুপে ভাগ করে। লেবেল ছাড়াই গ্রাহক segmentation, image compression-এ ব্যবহৃত।: ক্লাস্টারিং — একই ধরনের জিনিস একসাথে দল করা
  • Neural Networks: মস্তিষ্কের মতো নেটওয়ার্ক (এর গভীর সংস্করণই Deep Learning)

৪ · DL — গভীর নিউরাল নেটওয়ার্ক

সংজ্ঞা

Deep Learning হলো ML-এর একটি বিশেষ পদ্ধতি — যেখানে অনেক স্তরের (deep) কৃত্রিম নিউরাল নেটওয়ার্ক ব্যবহৃত হয়।

"Deep" শব্দটা আসে অনেকগুলো স্তর থাকার কারণে। একটি সাধারণ নিউরাল নেট-এ থাকতে পারে ১-২ স্তর। Deep নেটওয়ার্কে থাকতে পারে ১০, ১০০, এমনকি হাজারের বেশি স্তর। ২০১২-র AlexNetAlexNet (২০১২)Geoffrey Hinton-এর ছাত্র Alex Krizhevsky-র তৈরি ৮-স্তরের CNN. ImageNet প্রতিযোগিতায় error rate ২৬% থেকে ১৫.৩%-এ নামিয়ে আনে — পরের শ্রেষ্ঠ এন্ট্রির চেয়ে ১০.৮% ভালো। GPU-তে train. এই মুহূর্তটিকে Deep Learning বিপ্লবের সূচনা ধরা হয়। ছিল ৮ স্তর — এখনকার GPT-৪ মডেলে শত শত স্তর।

DL-এর বিখ্যাত উদাহরণ

  • CNN (Convolutional Neural Network): ছবি চেনায় ব্যবহৃত — যেমন আপনার মোবাইলের মুখ-চেনা
  • RNN/LSTM: ক্রমিক ডেটা — কণ্ঠ, লেখা
  • Transformer: আজকের ভাষা মডেল — ChatGPT, BERT, GPT
  • Diffusion ModelsDiffusion Modelএকটি জেনারেটিভ মডেল যা র‍্যান্ডম noise থেকে ধাপে ধাপে noise সরিয়ে ছবি তৈরি করে। Stable Diffusion, DALL-E 2, Midjourney — সবই এই পদ্ধতিতে কাজ করে।: ছবি তৈরি — Stable Diffusion, DALL-E

৫ · Feature Engineering — পুরোনো ML-এর কঠিন অংশ

একটি বাস্তব উদাহরণ দেওয়া যাক। ধরুন আপনি AI বানাতে চান যে ছবিতে বিড়াল আছে কি না বলবে।

পুরোনো ML পদ্ধতি (DL-এর আগে)

  1. একজন বিশেষজ্ঞ ছবি থেকে featuresFeatureraw ডেটা থেকে নিষ্কাশিত একটি অর্থপূর্ণ সংখ্যাসূচক বৈশিষ্ট্য — যা ML মডেলে input হিসেবে যায়। যেমন একটি বাড়ির দাম পূর্বাভাসে features হতে পারে: square footage, কক্ষ সংখ্যা, এলাকার নাম। ছবির ক্ষেত্রে পুরোনো features: SIFT, HOG, edge histogram. DL-এর আগে — feature বাছাই ছিল ML-এর সবচেয়ে শ্রমসাধ্য অংশ। বের করেন — যেমন: কয়টা চোখ, কান কেমন, লোমের রং, ইত্যাদি
  2. এই features-গুলো একটি ML অ্যালগরিদমে দেওয়া হয়
  3. অ্যালগরিদম শেখে — কোন features-এর সমন্বয় বিড়াল বোঝায়

সমস্যা — এই features বের করা প্রায় অসম্ভব। বিড়াল ছবি কোন কোণ থেকে তোলা, আলো কেমন, লোমের রং বদলালে — সব ক্ষেত্রে নতুন নিয়ম দরকার।

Deep Learning পদ্ধতি

  1. অনেক বিড়াল ও অ-বিড়াল ছবি একটি গভীর নিউরাল নেটে দেওয়া হয়
  2. নেটওয়ার্ক নিজেই features শেখে — মানুষকে কিছু বলতে হয় না
  3. প্রথম স্তরগুলো সরল features শেখে (প্রান্ত, রং)। গভীর স্তরগুলো জটিল features শেখে (চোখ, কান, পুরো বিড়াল)
DL-এর সবচেয়ে বড় অবদান — Feature engineering-এর প্রয়োজনীয়তা মুছে দেওয়া (এটি বলা হয় Representation LearningRepresentation Learningraw ডেটা (পিক্সেল, শব্দতরঙ্গ, অক্ষর) থেকে মডেল নিজেই অর্থপূর্ণ representation তৈরি করে — মানুষকে feature ডিজাইন করতে হয় না। Yoshua Bengio-র ২০১৩-র classic পেপার "Representation Learning: A Review" এই ধারণার ভিত্তি। DL-এর প্রকৃত শক্তি এখানে।)। এটাই DL-কে এত শক্তিশালী করেছে ছবি, কণ্ঠ ও ভাষায়। এখন বিশেষজ্ঞের জ্ঞানের চেয়ে বেশি ডেটা ও কম্পিউটিং বেশি গুরুত্বপূর্ণ।
AI ⊃ ML ⊃ DL Nested relationship 🌐 AI Artificial Intelligence 🤖 ML Machine Learning 🧠 DL Deep Learning CNN · Transformer AI মাত্র (ML নয়) নিয়মভিত্তিক · সার্চ · লজিক Deep Blue · Expert Systems Classical ML Linear Reg · SVM · Random Forest XGBoost · K-Means Deep Learning CNN · RNN · Transformer ChatGPT · Stable Diffusion
AI সবচেয়ে বড় ছাতা; ML হলো ডেটা থেকে শেখা AI; DL হলো অনেক স্তরের নিউরাল নেট ভিত্তিক ML.

৬ · কোনটা কখন ব্যবহার করব?

Symbolic AI ব্যবহার করুন যখন —

  • সমস্যাটির স্পষ্ট নিয়ম আছে (যেমন কর হিসাব)
  • ব্যাখ্যাযোগ্যতা গুরুত্বপূর্ণ (আইনি, চিকিৎসা)
  • ডেটা কম

Classical ML ব্যবহার করুন যখন —

  • আপনার কাছে structured data আছে (Excel-এর মতো টেবিল)
  • ডেটার পরিমাণ মাঝারি (হাজার থেকে লক্ষ সারি)
  • ব্যাখ্যাযোগ্যতা দরকার (Decision Trees পড়া যায়)

Deep Learning ব্যবহার করুন যখন —

  • ডেটা হলো ছবি, কণ্ঠ বা ভাষা
  • প্রচুর ডেটা আছে (লক্ষ থেকে কোটি)
  • প্যাটার্ন খুব জটিল — যা মানুষ নিয়ম দিয়ে বোঝাতে পারে না
  • GPU/TPU আছে কম্পিউটিং-এর জন্য
একটি সাধারণ ভুল — সব সমস্যায় Deep Learning ব্যবহার করতে চাওয়া। ছোট ডেটাসেটে সরল ML অ্যালগরিদম প্রায়ই DL-এর চেয়ে ভালো করে। সঠিক টুল বেছে নেওয়া একজন ভালো AI প্রকৌশলীর প্রধান দক্ষতা।

৭ · এক নজরে তুলনা

  • AI: বুদ্ধিমত্তার অনুকরণের যেকোনো পদ্ধতি — নিয়ম, সার্চ, ML সব।   (সবচেয়ে বড় ছাতা)
  • ML: ডেটা থেকে শেখার AI — feature মানুষ ডিজাইন করে।   (Linear Reg, Random Forest, SVM)
  • DL: বহু-স্তর নিউরাল নেট ভিত্তিক ML — feature নিজেই শেখে।   (CNN, Transformer, GPT)

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ Deep Blue (১৯৯৭) দাবায় Kasparov-কে হারাল। ChatGPT (২০২২) ভাষায় চমক দিল। দু'টিই AI — কিন্তু প্রকৌশলগতভাবে এদের পার্থক্য কী?

চমৎকার তুলনা — কারণ এই দু'টি প্রকল্প AI-র দু'টি ভিন্ন যুগের প্রতিনিধি। একই "AI" শব্দ, কিন্তু ভেতরের প্রকৌশল প্রায় বিপরীত।

Deep Blue (Symbolic AI + Search):

  • IBM-এর hand-coded দাবা মূল্যায়ন ফাংশন — ৮,০০০-এর বেশি বৈশিষ্ট্য বিশেষজ্ঞ গ্র্যান্ডমাস্টাররা ডিজাইন করেন।
  • প্রতি সেকেন্ডে ২০ কোটি অবস্থান বিশ্লেষণ — Alpha-Beta pruning সহ minimax search.
  • কোনো শেখা নেই। প্রতিটি নিয়ম মানুষ লিখেছে।
  • ছবি/ভাষা/গান — কিছুই বুঝে না। একমাত্র দাবা।

ChatGPT (Deep Learning):

  • হাজার হাজার GPU-তে কোটি কোটি পৃষ্ঠা টেক্সট থেকে ১৭৫ বিলিয়ন+ parameter স্ব-প্রশিক্ষিত।
  • কোনো hand-coded নিয়ম নেই — Transformer স্থাপত্য নিজেই ভাষার গঠন শিখেছে।
  • ভাষা, কোড, যুক্তি, এমনকি দাবা (যদিও সাধারণ মানের) — অনেক কাজে।
  • কিন্তু — সাধারণ যুক্তিতে ভুল করে; যা শেখেনি তা পারে না।

মূল উপলব্ধি: Deep Blue হলো "AI কিন্তু ML নয়" — শ্রেষ্ঠ উদাহরণ। ChatGPT হলো DL ⊂ ML ⊂ AI — তিনটি বৃত্তেই পড়ে। এই দু'টি পদ্ধতির পার্থক্যই পাঠ ০৩-এ আলোচিত Symbolic বনাম Connectionist বিতর্কের সবচেয়ে স্পষ্ট রূপ।

প্র ০২ "DL সব ক্ষেত্রে Classical ML-কে হারিয়ে দিয়েছে" — এই দাবি কতটা সত্য? Kaggle/বাস্তব প্রতিযোগিতার ফলাফল কী বলে?

সংক্ষেপে: দাবিটি ভুল। DL জিতেছে ছবি/কণ্ঠ/ভাষায়। কিন্তু structured (tabular) ডেটায় Classical ML — বিশেষত XGBoostXGBoost · Extreme Gradient Boosting২০১৪ সালে তৈরি একটি অত্যন্ত শক্তিশালী gradient boosting ML লাইব্রেরি। কয়েকশ Decision Tree একে একে ভুল ঠিক করতে করতে গড়ে। Tabular ডেটায় Kaggle প্রতিযোগিতার সবচেয়ে বেশি বিজয়ী মডেল।, LightGBM, CatBoost — এখনো রাজা।

Kaggle-এর প্রমাণ:

  • ২০১৫ থেকে আজ পর্যন্ত — tabular ডেটার প্রায় সব বড় Kaggle প্রতিযোগিতা XGBoost/LightGBM-এর variation দিয়ে জিতেছে।
  • NeurIPS/Google-এর গবেষণা (২০২২ "Why do tree-based models still outperform deep learning on tabular data?") দেখিয়েছে — মাঝারি tabular ডেটায় XGBoost সাধারণত সেরা DL মডেলের চেয়ে ভালো করে।
  • বিপরীতে — ImageNet, Speech, NLP-র সব benchmark DL-এর দখলে।

কেন এই পার্থক্য?

  • Tabular features ইতিমধ্যেই অর্থপূর্ণ: "বয়স", "আয়", "ক্রয় ইতিহাস" — মানুষ আগেই engineering করে রেখেছেন। DL-এর representation learning-এর সুবিধা এখানে নেই।
  • Tree-based models কম ডেটায় কাজ করে: ১০,০০০ সারি যথেষ্ট। DL-এর জন্য চাই ১০ লাখ+।
  • Heterogeneous columns: tabular ডেটায় প্রতিটি কলামের আলাদা type (categorical, numeric, ordinal)। Tree models এই বৈচিত্র্য সহজে handle করে।

বাস্তব নিয়ম: "Excel টেবিল-এ ফিট হলে — XGBoost দিয়ে শুরু করুন। ছবি/কণ্ঠ/টেক্সট হলে — DL." ২০২৪-এও Google/Meta-র অভ্যন্তরীণ অনেক production সিস্টেমে XGBoost চলছে — কোটি কোটি ব্যবহারকারীর জন্য।

প্র ০৩ Deep Learning ১৯৮০-র দশকেও তাত্ত্বিকভাবে সম্ভব ছিল। তবে কেন ২০১২-র আগে সে কাজ করেনি? কী বদলেছিল?

এটি AI ইতিহাসের সবচেয়ে আকর্ষণীয় ধাঁধা। অ্যালগরিদম প্রায় একই ছিল — backpropagation আবিষ্কৃত হয় ১৯৮৬-তে। তবু DL "কাজ" শুরু করল ২০১২-তে। তিনটি কারণ একসাথে এসে — যাকে বলা হয় "Perfect storm"।

(১) ডেটার বিস্ফোরণ — Big Data যুগ:

  • ১৯৯০-এ একটি train করার জন্য কয়েক হাজার ছবি — সর্বোচ্চ।
  • ২০০৯-এ Fei-Fei Li-র ImageNet ডেটাসেট: ১.৪ কোটি labeled ছবি, ২২,০০০ ক্যাটাগরি। DL-এর জন্য "জ্বালানি"।
  • ইন্টারনেট, smartphone, social media — ডেটার পরিমাণ বছরে কয়েকগুণ বাড়ছিল।

(২) কম্পিউটিং বিপ্লব — GPU:

  • NVIDIA-র গেমিং GPU (২০০৬-এ CUDA চালু) — সমান্তরাল গাণিতিক operation-এ অসাধারণ। ঠিক যা NN-এর দরকার।
  • একটি ১৯৯০-র CPU vs একটি ২০১২-র GPU — সমান কাজে ১০০-১,০০০ গুণ দ্রুত।
  • ফলস্বরূপ — যে training-এ আগে মাস লাগত, সেটা দিনে শেষ।

(৩) অ্যালগরিদমিক সংস্কার:

  • ReLU activationReLU · Rectified Linear Unitসবচেয়ে জনপ্রিয় activation function — গাণিতিকভাবে f(x) = max(0, x). সরল, দ্রুত, এবং vanishing gradient সমস্যা কমিয়ে দেয়। আধুনিক DL-এ প্রায় সবখানে ব্যবহৃত।: পুরোনো sigmoid-এর "vanishing gradient" সমস্যা সমাধান।
  • DropoutDropoutপ্রশিক্ষণের সময় randomly কিছু নিউরন বন্ধ রাখা — যাতে নেটওয়ার্ক একটি নির্দিষ্ট পথের উপর অতিনির্ভর না হয়ে যায়। সরল কিন্তু overfitting কমানোর শক্তিশালী কৌশল। (২০১২): overfittingOverfittingমডেল training data মুখস্থ করে ফেলে — কিন্তু নতুন ডেটায় ব্যর্থ হয়। ছাত্র যেমন প্রশ্নপত্র মুখস্থ করে নতুন প্রশ্নে আটকায়। ML-এর সবচেয়ে সাধারণ সমস্যা। কমানোর সহজ কৌশল।
  • Batch Normalization (২০১৫): বড় নেট সহজে train হয়।

২০১২-র মুহূর্ত: Krizhevsky, Sutskever ও Hinton-এর AlexNet — ImageNet-এ error rate ১০%-এর বেশি কমিয়ে দিল। সেটাই "DL revolution"-এর সূচনা।

মূল শিক্ষা: বুদ্ধিদীপ্ত ধারণা একা যথেষ্ট নয়। সঠিক ডেটা + সঠিক হার্ডওয়্যার + সঠিক সংস্কার — তিনটিই মিলে যেতে হয়। এই কারণেই AI-র প্রতিটি বড় অগ্রগতি সাধারণত একাধিক ক্ষেত্রের একসাথে পরিপক্বতার ফল।

প্র ০৪ আপনি ABCL TECH-এ একটি স্টার্টআপ চালু করতে চান। নিচের তিনটি সমস্যার জন্য Symbolic, Classical ML, না DL — কোনটি বাছবেন এবং কেন?

সঠিক টুল বাছাই — AI প্রকৌশলীর সবচেয়ে গুরুত্বপূর্ণ দক্ষতা। প্রতিটি সমস্যার জন্য ডেটা পরিমাণ, ধরন, ব্যাখ্যাযোগ্যতা ও খরচ বিচার করি।

(ক) ছোট প্রতিষ্ঠানে গ্রাহক churn পূর্বাভাস (২,০০০ গ্রাহক, Excel ডেটা):

  • উত্তর: Classical ML — বিশেষত XGBoost বা Logistic Regression.
  • ডেটা structured ও ছোট — DL overfit করবে।
  • "কেন এই গ্রাহক চলে যাচ্ছে?" — Decision Tree/SHAP দিয়ে ব্যাখ্যা সম্ভব। ব্যবসার জন্য জরুরি।
  • একটি laptop-এই train শেষ। GPU লাগবে না।

(খ) বাংলা কণ্ঠ থেকে লেখা তৈরি (Speech-to-Text):

  • উত্তর: Deep Learning — Wav2Vec2 / Whisper-ধাঁচের Transformer.
  • Raw audio — feature engineering প্রায় অসম্ভব। DL-এর representation learning দরকার।
  • প্রচুর বাংলা audio ডেটা দরকার (কয়েকশ ঘণ্টা minimum)।
  • OpenAI-র Whisper বাংলা সমর্থন করে — fine-tune করা সবচেয়ে দ্রুত পথ।

(গ) VAT হিসাব ও কর-নির্ধারণ:

  • উত্তর: Symbolic AI — পুরোনো ভাল old-school rules engine.
  • VAT-র নিয়ম স্পষ্ট, লিখিত আইনে আছে। ML-এর "প্রায় সঠিক" উত্তর গ্রহণযোগ্য নয় — আইনি বিষয়।
  • প্রতিটি সিদ্ধান্তের audit trail দরকার — যা rule-based system সরাসরি দেয়।
  • আইন বদলালে কেবল নিয়ম আপডেট — পুরো model retrain লাগে না।

সাধারণ নিয়ম মনে রাখুন: "ছোট + structured + ব্যাখ্যা চাই" → Classical ML. "বিশাল + raw (image/audio/text)" → DL. "স্পষ্ট নিয়ম + আইনি/নিরাপত্তা গুরুত্বপূর্ণ" → Symbolic. বাস্তব production সিস্টেম প্রায়ই এই তিনটির সংমিশ্রণ হয়।

অনুশীলন

  1. আঁকুন ও চিহ্নিত করুন: তিনটি বৃত্ত — AI, ML, DL — একটির ভেতরে আরেকটি আঁকুন। প্রতিটি স্তরে ৩টি করে বাস্তব উদাহরণ লিখুন (যা সেই স্তরে পড়ে কিন্তু ভেতরের স্তরে পড়ে না)।

    আদর্শ উত্তর:

    • শুধু AI (ML নয়):
      • Deep Blue — দাবা hand-coded heuristic + search
      • একটি Expert System — চিকিৎসা নির্ণয়ের নিয়মভিত্তিক সফটওয়্যার (যেমন MYCIN)
      • A* path-finding — গুগল ম্যাপ-এ পথ খোঁজা
    • ML কিন্তু DL নয় (Classical ML):
      • Spam filter — Naive Bayes দিয়ে
      • bKash fraud detection — XGBoost
      • Netflix recommendation — Matrix Factorization
    • DL:
      • ChatGPT — Transformer ভিত্তিক ভাষা মডেল
      • Tesla Autopilot — CNN ভিত্তিক ভিশন
      • Google Translate (modern) — sequence-to-sequence Transformer

    মূল কথা: AI ছাতা; এর ভেতরে কেবল কিছু পদ্ধতি ML; ML-এর ভেতরে কেবল কিছু পদ্ধতি DL.

  2. সিদ্ধান্ত নিন: নিচের প্রতিটি সমস্যার জন্য Symbolic, Classical ML, না DL?
    • একটি ছোট প্রতিষ্ঠানের গ্রাহকের চলে যাওয়ার (churn) পূর্বাভাস — ২,০০০ গ্রাহক
    • বাংলা কণ্ঠ থেকে লেখা তৈরি
    • VAT হিসাব
    • বাংলাদেশী গাড়ির লাইসেন্স প্লেট পড়া
    • একটি ই-কমার্স সাইটে পণ্যের সুপারিশ — ১ লাখ গ্রাহক, ৫,০০০ পণ্য
    • Churn (২,০০০ গ্রাহক): Classical ML. Random Forest বা XGBoost যথেষ্ট। ছোট structured ডেটা।
    • বাংলা Speech-to-Text: DL. Wav2Vec2 বা Whisper fine-tune. Raw audio-তে DL ছাড়া উপায় নেই।
    • VAT হিসাব: Symbolic. আইনের নিয়ম স্পষ্ট, audit trail দরকার, "প্রায় সঠিক" চলবে না।
    • লাইসেন্স প্লেট পড়া: DL — দু'ধাপে। ক) Object detection (CNN, যেমন YOLO) প্লেট খুঁজে বের করতে; খ) OCR (CNN+CTC বা Transformer) সংখ্যা/বাংলা অক্ষর পড়তে।
    • পণ্য সুপারিশ (১ লাখ × ৫,০০০): মাঝামাঝি — শুরু করুন Classical ML দিয়ে (Matrix Factorization বা LightFM)। ডেটা বাড়লে DL-based (Two-Tower) মডেলে উন্নীত করুন।

    সাধারণ পদ্ধতি: সবসময় সবচেয়ে সহজ পদ্ধতি দিয়ে শুরু করুন। যথেষ্ট না হলেই জটিলতা বাড়ান।

  3. চিন্তা করুন: কেন DL আগে কাজ করত না — কিন্তু ২০১২-এর পর হঠাৎ কাজ শুরু করল? পাঠ ০২ থেকে স্মরণ করুন এবং অন্তত তিনটি কারণ লিখুন।

    তিনটি প্রধান কারণ — "Perfect Storm":

    1. বিশাল ডেটা: ImageNet (২০০৯) ১.৪ কোটি labeled ছবি দিল। ইন্টারনেট ও smartphone-এর প্রসার ডেটার বন্যা সৃষ্টি করল।
    2. GPU বিপ্লব: NVIDIA-র CUDA (২০০৬) — gaming GPU-কে general-purpose সমান্তরাল কম্পিউটিং-এ রূপান্তর। DL training ১০০-১,০০০ গুণ দ্রুত হলো।
    3. অ্যালগরিদমিক সংস্কার: ReLU activation (vanishing gradient সমাধান), Dropout (overfitting কমানো), Batch Normalization — বড় নেটওয়ার্ক train করা সম্ভব হলো।

    ২০১২-র মুহূর্ত: Hinton-র দল AlexNet দিয়ে ImageNet চ্যালেঞ্জ জিতলেন — error rate ২৬% থেকে ১৫.৩%-এ। এই ফলাফল গবেষক ও শিল্পপ্রতিষ্ঠানের চোখ খুলে দিল। তারপরই Google, Facebook, Microsoft সবাই DL-এ বিনিয়োগ শুরু করল।

    মূল শিক্ষা: তত্ত্ব আগেই ছিল (backpropagation ১৯৮৬)। কিন্তু তত্ত্ব + ডেটা + হার্ডওয়্যার + সংস্কার — সবগুলো একসাথে এলে তবেই বিপ্লব হয়।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

কোড রানার কাজ না করলে? এই পাঠে কোডের ব্লক নেই — পরের পাঠ থেকে শুরু হবে। ব্রাউজারে কাজ না করলে Google Colab ব্যবহার করুন — Google-এর ফ্রি অনলাইন Python পরিবেশ, শুধু Gmail অ্যাকাউন্ট লাগে।
পূর্ববর্তী পাঠ
পাঠ ০৪ · ANI, AGI ও ASI