AI বনাম ML বনাম Deep Learning
এই পাঠে যা শিখবেন
- AI, ML, DL — তিনটি শব্দের সম্পর্ক ও পার্থক্য পরিষ্কার বুঝবেন
- প্রতিটির বাস্তব উদাহরণ চিনবেন
- "Feature engineering" কী, কেন DL এসে এটাকে অপ্রয়োজনীয় করে দিল
- একটি সমস্যার জন্য কোন পদ্ধতি বাছবেন — সিদ্ধান্ত নেওয়ার নিয়ম
১ · তিনটি শব্দ, একটি সম্পর্ক
খবর-কাগজে AI, Machine Learning ও Deep Learning — শব্দ তিনটি প্রায়ই একই অর্থে ব্যবহার করা হয়। কিন্তু এগুলোর মধ্যে স্পষ্ট সম্পর্ক আছে — একটি অন্যটির ভেতরে।
AI বৃহত্তম বৃত্ত। ML AI-এর ভিতরে একটি ছোট বৃত্ত। DL ML-এর ভিতরে আরও ছোট বৃত্ত।
DL ⊂ ML ⊂ AI
চলুন একে একে দেখি।
২ · AI — সবচেয়ে বড় বৃত্ত
যেকোনো সিস্টেম যা মানুষের বুদ্ধিমত্তার অনুকরণ করার চেষ্টা করে — তা AI. এতে অনেক পদ্ধতি থাকতে পারে —
- নিয়মভিত্তিক সিস্টেম (Symbolic AI)
- সার্চ অ্যালগরিদম (যেমন দাবা প্রোগ্রাম)
- লজিক ও যুক্তি-প্রমাণ সিস্টেম
- Machine Learning
- Deep Learning
সবগুলোই AI. কিন্তু সব AI ML নয়।
৩ · ML — যে AI ডেটা থেকে শেখে
Machine Learning হলো AI-এর একটি উপশাখা — যেখানে যন্ত্রকে স্পষ্টভাবে প্রোগ্রাম না করে ডেটা থেকে নিজে শিখতে দেওয়া হয়।
Tom Mitchell-এর সংজ্ঞা (১৯৯৭)Tom MitchellCarnegie Mellon University-র অধ্যাপক, ML-এর pioneer. তাঁর ১৯৯৭-এর বই "Machine Learning" দশকের পর দশক ধরে ML-এর প্রথম পাঠ্যবই। T-E-P সংজ্ঞাটি আজও ML-এর সবচেয়ে নির্ভুল formal সংজ্ঞা।: একটি কম্পিউটার প্রোগ্রাম একটি কাজ T-এ অভিজ্ঞতা E থেকে শেখে যদি পরিমাপ P-এ তার পারফরম্যান্স অভিজ্ঞতা E-এর সাথে উন্নত হয়।
ML-এর কয়েকটি ক্লাসিক পদ্ধতি
- Linear RegressionLinear Regressionসবচেয়ে সরল ML অ্যালগরিদম — input ও output-এর মধ্যে একটি সরলরেখার সম্পর্ক ফিট করে। যেমন: বাড়ির আয়তন থেকে দামের পূর্বাভাস। সব ML কোর্সের প্রথম পাঠ।: সংখ্যার পূর্বাভাস (যেমন বাড়ির দাম)
- Decision TreesDecision Tree"যদি-তাহলে" প্রশ্নের গাছ। প্রতিটি নোডে একটি প্রশ্ন (যেমন "বয়স > ৩০?"), উত্তরের ভিত্তিতে শাখা ভাগ হয়। মানুষ পড়তে পারে — তাই ব্যাখ্যাযোগ্য।: "যদি-তাহলে" প্রশ্নের গাছ
- Random ForestRandom Forestশত শত Decision Tree-র সম্মিলিত উত্তর — গণতান্ত্রিক ভোটের মতো। একক Tree-র চেয়ে অনেক বেশি নির্ভুল। Tabular ডেটার অন্যতম জনপ্রিয় ML মডেল।: অনেক Decision Tree একসাথে
- SVM (Support Vector Machine)SVM · Support Vector Machineদুই শ্রেণির ডেটা পয়েন্টের মাঝে সর্বাধিক ব্যবধান (margin) তৈরি করে এমন রেখা/সমতল খুঁজে বের করে। DL-এর আগে text classification-এর সেরা পদ্ধতি ছিল।: দুই শ্রেণিকে আলাদা করার সর্বোত্তম রেখা
- K-MeansK-Meansসবচেয়ে জনপ্রিয় unsupervised clustering অ্যালগরিদম — ডেটাকে K-টি গ্রুপে ভাগ করে। লেবেল ছাড়াই গ্রাহক segmentation, image compression-এ ব্যবহৃত।: ক্লাস্টারিং — একই ধরনের জিনিস একসাথে দল করা
- Neural Networks: মস্তিষ্কের মতো নেটওয়ার্ক (এর গভীর সংস্করণই Deep Learning)
৪ · DL — গভীর নিউরাল নেটওয়ার্ক
Deep Learning হলো ML-এর একটি বিশেষ পদ্ধতি — যেখানে অনেক স্তরের (deep) কৃত্রিম নিউরাল নেটওয়ার্ক ব্যবহৃত হয়।
"Deep" শব্দটা আসে অনেকগুলো স্তর থাকার কারণে। একটি সাধারণ নিউরাল নেট-এ থাকতে পারে ১-২ স্তর। Deep নেটওয়ার্কে থাকতে পারে ১০, ১০০, এমনকি হাজারের বেশি স্তর। ২০১২-র AlexNetAlexNet (২০১২)Geoffrey Hinton-এর ছাত্র Alex Krizhevsky-র তৈরি ৮-স্তরের CNN. ImageNet প্রতিযোগিতায় error rate ২৬% থেকে ১৫.৩%-এ নামিয়ে আনে — পরের শ্রেষ্ঠ এন্ট্রির চেয়ে ১০.৮% ভালো। GPU-তে train. এই মুহূর্তটিকে Deep Learning বিপ্লবের সূচনা ধরা হয়। ছিল ৮ স্তর — এখনকার GPT-৪ মডেলে শত শত স্তর।
DL-এর বিখ্যাত উদাহরণ
- CNN (Convolutional Neural Network): ছবি চেনায় ব্যবহৃত — যেমন আপনার মোবাইলের মুখ-চেনা
- RNN/LSTM: ক্রমিক ডেটা — কণ্ঠ, লেখা
- Transformer: আজকের ভাষা মডেল — ChatGPT, BERT, GPT
- Diffusion ModelsDiffusion Modelএকটি জেনারেটিভ মডেল যা র্যান্ডম noise থেকে ধাপে ধাপে noise সরিয়ে ছবি তৈরি করে। Stable Diffusion, DALL-E 2, Midjourney — সবই এই পদ্ধতিতে কাজ করে।: ছবি তৈরি — Stable Diffusion, DALL-E
৫ · Feature Engineering — পুরোনো ML-এর কঠিন অংশ
একটি বাস্তব উদাহরণ দেওয়া যাক। ধরুন আপনি AI বানাতে চান যে ছবিতে বিড়াল আছে কি না বলবে।
পুরোনো ML পদ্ধতি (DL-এর আগে)
- একজন বিশেষজ্ঞ ছবি থেকে featuresFeatureraw ডেটা থেকে নিষ্কাশিত একটি অর্থপূর্ণ সংখ্যাসূচক বৈশিষ্ট্য — যা ML মডেলে input হিসেবে যায়। যেমন একটি বাড়ির দাম পূর্বাভাসে features হতে পারে: square footage, কক্ষ সংখ্যা, এলাকার নাম। ছবির ক্ষেত্রে পুরোনো features: SIFT, HOG, edge histogram. DL-এর আগে — feature বাছাই ছিল ML-এর সবচেয়ে শ্রমসাধ্য অংশ। বের করেন — যেমন: কয়টা চোখ, কান কেমন, লোমের রং, ইত্যাদি
- এই features-গুলো একটি ML অ্যালগরিদমে দেওয়া হয়
- অ্যালগরিদম শেখে — কোন features-এর সমন্বয় বিড়াল বোঝায়
সমস্যা — এই features বের করা প্রায় অসম্ভব। বিড়াল ছবি কোন কোণ থেকে তোলা, আলো কেমন, লোমের রং বদলালে — সব ক্ষেত্রে নতুন নিয়ম দরকার।
Deep Learning পদ্ধতি
- অনেক বিড়াল ও অ-বিড়াল ছবি একটি গভীর নিউরাল নেটে দেওয়া হয়
- নেটওয়ার্ক নিজেই features শেখে — মানুষকে কিছু বলতে হয় না
- প্রথম স্তরগুলো সরল features শেখে (প্রান্ত, রং)। গভীর স্তরগুলো জটিল features শেখে (চোখ, কান, পুরো বিড়াল)
৬ · কোনটা কখন ব্যবহার করব?
Symbolic AI ব্যবহার করুন যখন —
- সমস্যাটির স্পষ্ট নিয়ম আছে (যেমন কর হিসাব)
- ব্যাখ্যাযোগ্যতা গুরুত্বপূর্ণ (আইনি, চিকিৎসা)
- ডেটা কম
Classical ML ব্যবহার করুন যখন —
- আপনার কাছে structured data আছে (Excel-এর মতো টেবিল)
- ডেটার পরিমাণ মাঝারি (হাজার থেকে লক্ষ সারি)
- ব্যাখ্যাযোগ্যতা দরকার (Decision Trees পড়া যায়)
Deep Learning ব্যবহার করুন যখন —
- ডেটা হলো ছবি, কণ্ঠ বা ভাষা
- প্রচুর ডেটা আছে (লক্ষ থেকে কোটি)
- প্যাটার্ন খুব জটিল — যা মানুষ নিয়ম দিয়ে বোঝাতে পারে না
- GPU/TPU আছে কম্পিউটিং-এর জন্য
৭ · এক নজরে তুলনা
- AI: বুদ্ধিমত্তার অনুকরণের যেকোনো পদ্ধতি — নিয়ম, সার্চ, ML সব। (সবচেয়ে বড় ছাতা)
- ML: ডেটা থেকে শেখার AI — feature মানুষ ডিজাইন করে। (Linear Reg, Random Forest, SVM)
- DL: বহু-স্তর নিউরাল নেট ভিত্তিক ML — feature নিজেই শেখে। (CNN, Transformer, GPT)
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ Deep Blue (১৯৯৭) দাবায় Kasparov-কে হারাল। ChatGPT (২০২২) ভাষায় চমক দিল। দু'টিই AI — কিন্তু প্রকৌশলগতভাবে এদের পার্থক্য কী?
চমৎকার তুলনা — কারণ এই দু'টি প্রকল্প AI-র দু'টি ভিন্ন যুগের প্রতিনিধি। একই "AI" শব্দ, কিন্তু ভেতরের প্রকৌশল প্রায় বিপরীত।
Deep Blue (Symbolic AI + Search):
- IBM-এর hand-coded দাবা মূল্যায়ন ফাংশন — ৮,০০০-এর বেশি বৈশিষ্ট্য বিশেষজ্ঞ গ্র্যান্ডমাস্টাররা ডিজাইন করেন।
- প্রতি সেকেন্ডে ২০ কোটি অবস্থান বিশ্লেষণ — Alpha-Beta pruning সহ minimax search.
- কোনো শেখা নেই। প্রতিটি নিয়ম মানুষ লিখেছে।
- ছবি/ভাষা/গান — কিছুই বুঝে না। একমাত্র দাবা।
ChatGPT (Deep Learning):
- হাজার হাজার GPU-তে কোটি কোটি পৃষ্ঠা টেক্সট থেকে ১৭৫ বিলিয়ন+ parameter স্ব-প্রশিক্ষিত।
- কোনো hand-coded নিয়ম নেই — Transformer স্থাপত্য নিজেই ভাষার গঠন শিখেছে।
- ভাষা, কোড, যুক্তি, এমনকি দাবা (যদিও সাধারণ মানের) — অনেক কাজে।
- কিন্তু — সাধারণ যুক্তিতে ভুল করে; যা শেখেনি তা পারে না।
মূল উপলব্ধি: Deep Blue হলো "AI কিন্তু ML নয়" — শ্রেষ্ঠ উদাহরণ। ChatGPT হলো DL ⊂ ML ⊂ AI — তিনটি বৃত্তেই পড়ে। এই দু'টি পদ্ধতির পার্থক্যই পাঠ ০৩-এ আলোচিত Symbolic বনাম Connectionist বিতর্কের সবচেয়ে স্পষ্ট রূপ।
প্র ০২ "DL সব ক্ষেত্রে Classical ML-কে হারিয়ে দিয়েছে" — এই দাবি কতটা সত্য? Kaggle/বাস্তব প্রতিযোগিতার ফলাফল কী বলে?
সংক্ষেপে: দাবিটি ভুল। DL জিতেছে ছবি/কণ্ঠ/ভাষায়। কিন্তু structured (tabular) ডেটায় Classical ML — বিশেষত XGBoostXGBoost · Extreme Gradient Boosting২০১৪ সালে তৈরি একটি অত্যন্ত শক্তিশালী gradient boosting ML লাইব্রেরি। কয়েকশ Decision Tree একে একে ভুল ঠিক করতে করতে গড়ে। Tabular ডেটায় Kaggle প্রতিযোগিতার সবচেয়ে বেশি বিজয়ী মডেল।, LightGBM, CatBoost — এখনো রাজা।
Kaggle-এর প্রমাণ:
- ২০১৫ থেকে আজ পর্যন্ত — tabular ডেটার প্রায় সব বড় Kaggle প্রতিযোগিতা XGBoost/LightGBM-এর variation দিয়ে জিতেছে।
- NeurIPS/Google-এর গবেষণা (২০২২ "Why do tree-based models still outperform deep learning on tabular data?") দেখিয়েছে — মাঝারি tabular ডেটায় XGBoost সাধারণত সেরা DL মডেলের চেয়ে ভালো করে।
- বিপরীতে — ImageNet, Speech, NLP-র সব benchmark DL-এর দখলে।
কেন এই পার্থক্য?
- Tabular features ইতিমধ্যেই অর্থপূর্ণ: "বয়স", "আয়", "ক্রয় ইতিহাস" — মানুষ আগেই engineering করে রেখেছেন। DL-এর representation learning-এর সুবিধা এখানে নেই।
- Tree-based models কম ডেটায় কাজ করে: ১০,০০০ সারি যথেষ্ট। DL-এর জন্য চাই ১০ লাখ+।
- Heterogeneous columns: tabular ডেটায় প্রতিটি কলামের আলাদা type (categorical, numeric, ordinal)। Tree models এই বৈচিত্র্য সহজে handle করে।
বাস্তব নিয়ম: "Excel টেবিল-এ ফিট হলে — XGBoost দিয়ে শুরু করুন। ছবি/কণ্ঠ/টেক্সট হলে — DL." ২০২৪-এও Google/Meta-র অভ্যন্তরীণ অনেক production সিস্টেমে XGBoost চলছে — কোটি কোটি ব্যবহারকারীর জন্য।
প্র ০৩ Deep Learning ১৯৮০-র দশকেও তাত্ত্বিকভাবে সম্ভব ছিল। তবে কেন ২০১২-র আগে সে কাজ করেনি? কী বদলেছিল?
এটি AI ইতিহাসের সবচেয়ে আকর্ষণীয় ধাঁধা। অ্যালগরিদম প্রায় একই ছিল — backpropagation আবিষ্কৃত হয় ১৯৮৬-তে। তবু DL "কাজ" শুরু করল ২০১২-তে। তিনটি কারণ একসাথে এসে — যাকে বলা হয় "Perfect storm"।
(১) ডেটার বিস্ফোরণ — Big Data যুগ:
- ১৯৯০-এ একটি train করার জন্য কয়েক হাজার ছবি — সর্বোচ্চ।
- ২০০৯-এ Fei-Fei Li-র ImageNet ডেটাসেট: ১.৪ কোটি labeled ছবি, ২২,০০০ ক্যাটাগরি। DL-এর জন্য "জ্বালানি"।
- ইন্টারনেট, smartphone, social media — ডেটার পরিমাণ বছরে কয়েকগুণ বাড়ছিল।
(২) কম্পিউটিং বিপ্লব — GPU:
- NVIDIA-র গেমিং GPU (২০০৬-এ CUDA চালু) — সমান্তরাল গাণিতিক operation-এ অসাধারণ। ঠিক যা NN-এর দরকার।
- একটি ১৯৯০-র CPU vs একটি ২০১২-র GPU — সমান কাজে ১০০-১,০০০ গুণ দ্রুত।
- ফলস্বরূপ — যে training-এ আগে মাস লাগত, সেটা দিনে শেষ।
(৩) অ্যালগরিদমিক সংস্কার:
- ReLU activationReLU · Rectified Linear Unitসবচেয়ে জনপ্রিয় activation function — গাণিতিকভাবে f(x) = max(0, x). সরল, দ্রুত, এবং vanishing gradient সমস্যা কমিয়ে দেয়। আধুনিক DL-এ প্রায় সবখানে ব্যবহৃত।: পুরোনো sigmoid-এর "vanishing gradient" সমস্যা সমাধান।
- DropoutDropoutপ্রশিক্ষণের সময় randomly কিছু নিউরন বন্ধ রাখা — যাতে নেটওয়ার্ক একটি নির্দিষ্ট পথের উপর অতিনির্ভর না হয়ে যায়। সরল কিন্তু overfitting কমানোর শক্তিশালী কৌশল। (২০১২): overfittingOverfittingমডেল training data মুখস্থ করে ফেলে — কিন্তু নতুন ডেটায় ব্যর্থ হয়। ছাত্র যেমন প্রশ্নপত্র মুখস্থ করে নতুন প্রশ্নে আটকায়। ML-এর সবচেয়ে সাধারণ সমস্যা। কমানোর সহজ কৌশল।
- Batch Normalization (২০১৫): বড় নেট সহজে train হয়।
২০১২-র মুহূর্ত: Krizhevsky, Sutskever ও Hinton-এর AlexNet — ImageNet-এ error rate ১০%-এর বেশি কমিয়ে দিল। সেটাই "DL revolution"-এর সূচনা।
মূল শিক্ষা: বুদ্ধিদীপ্ত ধারণা একা যথেষ্ট নয়। সঠিক ডেটা + সঠিক হার্ডওয়্যার + সঠিক সংস্কার — তিনটিই মিলে যেতে হয়। এই কারণেই AI-র প্রতিটি বড় অগ্রগতি সাধারণত একাধিক ক্ষেত্রের একসাথে পরিপক্বতার ফল।
প্র ০৪ আপনি ABCL TECH-এ একটি স্টার্টআপ চালু করতে চান। নিচের তিনটি সমস্যার জন্য Symbolic, Classical ML, না DL — কোনটি বাছবেন এবং কেন?
সঠিক টুল বাছাই — AI প্রকৌশলীর সবচেয়ে গুরুত্বপূর্ণ দক্ষতা। প্রতিটি সমস্যার জন্য ডেটা পরিমাণ, ধরন, ব্যাখ্যাযোগ্যতা ও খরচ বিচার করি।
(ক) ছোট প্রতিষ্ঠানে গ্রাহক churn পূর্বাভাস (২,০০০ গ্রাহক, Excel ডেটা):
- উত্তর: Classical ML — বিশেষত XGBoost বা Logistic Regression.
- ডেটা structured ও ছোট — DL overfit করবে।
- "কেন এই গ্রাহক চলে যাচ্ছে?" — Decision Tree/SHAP দিয়ে ব্যাখ্যা সম্ভব। ব্যবসার জন্য জরুরি।
- একটি laptop-এই train শেষ। GPU লাগবে না।
(খ) বাংলা কণ্ঠ থেকে লেখা তৈরি (Speech-to-Text):
- উত্তর: Deep Learning — Wav2Vec2 / Whisper-ধাঁচের Transformer.
- Raw audio — feature engineering প্রায় অসম্ভব। DL-এর representation learning দরকার।
- প্রচুর বাংলা audio ডেটা দরকার (কয়েকশ ঘণ্টা minimum)।
- OpenAI-র Whisper বাংলা সমর্থন করে — fine-tune করা সবচেয়ে দ্রুত পথ।
(গ) VAT হিসাব ও কর-নির্ধারণ:
- উত্তর: Symbolic AI — পুরোনো ভাল old-school rules engine.
- VAT-র নিয়ম স্পষ্ট, লিখিত আইনে আছে। ML-এর "প্রায় সঠিক" উত্তর গ্রহণযোগ্য নয় — আইনি বিষয়।
- প্রতিটি সিদ্ধান্তের audit trail দরকার — যা rule-based system সরাসরি দেয়।
- আইন বদলালে কেবল নিয়ম আপডেট — পুরো model retrain লাগে না।
সাধারণ নিয়ম মনে রাখুন: "ছোট + structured + ব্যাখ্যা চাই" → Classical ML. "বিশাল + raw (image/audio/text)" → DL. "স্পষ্ট নিয়ম + আইনি/নিরাপত্তা গুরুত্বপূর্ণ" → Symbolic. বাস্তব production সিস্টেম প্রায়ই এই তিনটির সংমিশ্রণ হয়।
অনুশীলন
-
আঁকুন ও চিহ্নিত করুন: তিনটি বৃত্ত — AI, ML, DL — একটির ভেতরে আরেকটি আঁকুন। প্রতিটি স্তরে ৩টি করে বাস্তব উদাহরণ লিখুন (যা সেই স্তরে পড়ে কিন্তু ভেতরের স্তরে পড়ে না)।
আদর্শ উত্তর:
-
শুধু AI (ML নয়):
- Deep Blue — দাবা hand-coded heuristic + search
- একটি Expert System — চিকিৎসা নির্ণয়ের নিয়মভিত্তিক সফটওয়্যার (যেমন MYCIN)
- A* path-finding — গুগল ম্যাপ-এ পথ খোঁজা
-
ML কিন্তু DL নয় (Classical ML):
- Spam filter — Naive Bayes দিয়ে
- bKash fraud detection — XGBoost
- Netflix recommendation — Matrix Factorization
-
DL:
- ChatGPT — Transformer ভিত্তিক ভাষা মডেল
- Tesla Autopilot — CNN ভিত্তিক ভিশন
- Google Translate (modern) — sequence-to-sequence Transformer
মূল কথা: AI ছাতা; এর ভেতরে কেবল কিছু পদ্ধতি ML; ML-এর ভেতরে কেবল কিছু পদ্ধতি DL.
-
শুধু AI (ML নয়):
-
সিদ্ধান্ত নিন: নিচের প্রতিটি সমস্যার জন্য Symbolic, Classical ML, না DL?
- একটি ছোট প্রতিষ্ঠানের গ্রাহকের চলে যাওয়ার (churn) পূর্বাভাস — ২,০০০ গ্রাহক
- বাংলা কণ্ঠ থেকে লেখা তৈরি
- VAT হিসাব
- বাংলাদেশী গাড়ির লাইসেন্স প্লেট পড়া
- একটি ই-কমার্স সাইটে পণ্যের সুপারিশ — ১ লাখ গ্রাহক, ৫,০০০ পণ্য
- Churn (২,০০০ গ্রাহক): Classical ML. Random Forest বা XGBoost যথেষ্ট। ছোট structured ডেটা।
- বাংলা Speech-to-Text: DL. Wav2Vec2 বা Whisper fine-tune. Raw audio-তে DL ছাড়া উপায় নেই।
- VAT হিসাব: Symbolic. আইনের নিয়ম স্পষ্ট, audit trail দরকার, "প্রায় সঠিক" চলবে না।
- লাইসেন্স প্লেট পড়া: DL — দু'ধাপে। ক) Object detection (CNN, যেমন YOLO) প্লেট খুঁজে বের করতে; খ) OCR (CNN+CTC বা Transformer) সংখ্যা/বাংলা অক্ষর পড়তে।
- পণ্য সুপারিশ (১ লাখ × ৫,০০০): মাঝামাঝি — শুরু করুন Classical ML দিয়ে (Matrix Factorization বা LightFM)। ডেটা বাড়লে DL-based (Two-Tower) মডেলে উন্নীত করুন।
সাধারণ পদ্ধতি: সবসময় সবচেয়ে সহজ পদ্ধতি দিয়ে শুরু করুন। যথেষ্ট না হলেই জটিলতা বাড়ান।
-
চিন্তা করুন: কেন DL আগে কাজ করত না — কিন্তু ২০১২-এর পর হঠাৎ কাজ শুরু করল? পাঠ ০২ থেকে স্মরণ করুন এবং অন্তত তিনটি কারণ লিখুন।
তিনটি প্রধান কারণ — "Perfect Storm":
- বিশাল ডেটা: ImageNet (২০০৯) ১.৪ কোটি labeled ছবি দিল। ইন্টারনেট ও smartphone-এর প্রসার ডেটার বন্যা সৃষ্টি করল।
- GPU বিপ্লব: NVIDIA-র CUDA (২০০৬) — gaming GPU-কে general-purpose সমান্তরাল কম্পিউটিং-এ রূপান্তর। DL training ১০০-১,০০০ গুণ দ্রুত হলো।
- অ্যালগরিদমিক সংস্কার: ReLU activation (vanishing gradient সমাধান), Dropout (overfitting কমানো), Batch Normalization — বড় নেটওয়ার্ক train করা সম্ভব হলো।
২০১২-র মুহূর্ত: Hinton-র দল AlexNet দিয়ে ImageNet চ্যালেঞ্জ জিতলেন — error rate ২৬% থেকে ১৫.৩%-এ। এই ফলাফল গবেষক ও শিল্পপ্রতিষ্ঠানের চোখ খুলে দিল। তারপরই Google, Facebook, Microsoft সবাই DL-এ বিনিয়োগ শুরু করল।
মূল শিক্ষা: তত্ত্ব আগেই ছিল (backpropagation ১৯৮৬)। কিন্তু তত্ত্ব + ডেটা + হার্ডওয়্যার + সংস্কার — সবগুলো একসাথে এলে তবেই বিপ্লব হয়।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- পাঠ ০৬ · AI সমস্যার ধরন পরবর্তী পাঠ Classification, Regression, Clustering — কোন সমস্যা কোন ধরনের, এবং কোন পদ্ধতি কাকে মেলায়।
- পাঠ ০৩ · প্রতীকী বনাম সংযোগবাদী AI আগের পাঠ "AI কিন্তু ML নয়" — সেই অংশের গভীর আলোচনা। Symbolic AI কেন প্রয়োজনীয় এখনো।
- পাঠ ০৪ · ANI, AGI ও ASI এই পাঠের সাথে সম্পর্কিত DL আজ ANI বানাচ্ছে। AGI পেতে আরও কী লাগবে — Yann LeCun-র "World Models" দৃষ্টিভঙ্গি।
- পাঠ ০২ · AI-এর ইতিহাস এই পাঠের সাথে সম্পর্কিত ২০১২-র AlexNet মুহূর্ত, ১৯৮৬-র backpropagation, পুরো DL উত্থানের পটভূমি।
- সব AI Courses দেখুন ABCL TECH Python, ML, DL, NLP, CV, GenAI, RL, MLOps — সব AI কোর্স একসাথে।
- AI সংবাদ ও সাম্প্রতিক ঘটনাবলি Blog Transformer, Diffusion, LLM — সাম্প্রতিক DL উদ্ভাবনের খবর বাংলায়।