পাঠ ১ · ২৮-এর মধ্যে · মডিউল ১
Home / AI Courses / জেনারেটিভ AI / জেনারেটিভ AI কী

জেনারেটিভ AI কী — কেন এত গুরুত্বপূর্ণ

What is generative AI — and why it matters
৬ মিনিট পড়া উচ্চ · Advanced ChatGPT · DALL-E · Sora

এই পাঠে যা শিখবেন

  • Generative AI-র সংজ্ঞা — ৩ ভিন্ন দৃষ্টিকোণে
  • Discriminative AI ও Generative AI-র মৌলিক পার্থক্য
  • Generative AI-র ইতিহাস — ১৯৬৬-এর ELIZA থেকে ২০২৪-এর Sora পর্যন্ত
  • "কেন এখন" — compute, data, architecture-এর তিন বিপ্লব

১ · জেনারেটিভ AI — সংজ্ঞা

Generative AIGenerative AIযে AI মডেল নতুন data তৈরি করে — শুধু classify বা predict না। ChatGPT লেখা, DALL-E ছবি, Sora ভিডিও — সবই generative। গণিতে: $P(x)$ শিখে সেখান থেকে sample। হলো এমন AI যা নতুন কিছু তৈরি করে। শুধু "এই ছবিটা কি বিড়াল?" বলে না — বরং "একটি বিড়ালের ছবি আঁকো" বললে এঁকে দেয়। শুধু "এই sentence-এর sentiment positive না negative?" বলে না — বরং "একটি কবিতা লেখো" বললে লিখে দেয়।

তিন দৃষ্টিকোণ — একই ধারণা

১) ব্যবহারিক: যে AI text, image, audio, video, code তৈরি করে।
২) গাণিতিক: যে মডেল ডেটার distribution $P(x)$ শেখে এবং সেখান থেকে নতুন sample তোলে।
৩) দার্শনিক: যে মডেল "সৃজনশীল" আচরণ করে — যা training-এ দেখেনি, তাও তৈরি করে।

ChatGPT, Claude, Gemini, DALL-E, Midjourney, Stable Diffusion, Sora, GitHub Copilot, ElevenLabs — সব generative AI। এদের একটিই common ক্ষমতা: distribution থেকে sample।

২ · Discriminative বনাম Generative — মূল পার্থক্য

AI-র দু'টি বড় paradigm আছে। তাদের মূল পার্থক্য — কোন প্রশ্নের উত্তর তারা দেয়।

একজন discriminative শিল্প-সমালোচক ছবি দেখে বলতে পারেন — "এটি Van Gogh-এর আঁকা।" কিন্তু তিনি নিজে Van Gogh-এর মতো ছবি আঁকতে পারেন না। একজন generative শিল্পী Van Gogh-এর শৈলীতে নতুন ছবি আঁকতে পারেন — কারণ তিনি Van Gogh-এর "ছবি আঁকার ভাষা" বুঝেছেন। AI-তেও সেই পার্থক্য।

Discriminative model শেখে $P(y|x)$ — "$x$ দেওয়া থাকলে label $y$ কী?" উদাহরণ: spam classifier, image recognizer, sentiment analyzer। Generative model শেখে $P(x)$ বা $P(x, y)$ — "$x$ নিজেই কেমন দেখায়?" উদাহরণ: GAN, VAE, Diffusion, GPT।

গাণিতিকভাবে, Bayes-এর সূত্রে দেখা যায় — generative model থেকে discriminative model বানানো যায়, কিন্তু উল্টোটা যায় না:

$$P(y|x) = \frac{P(x|y) \cdot P(y)}{P(x)}$$

তাই বলা হয় — generative হলো "harder problem"। কিন্তু পুরস্কারও বড় — সৃষ্টিশীলতা।

৩ · ছোট্ট ইতিহাস — ELIZA থেকে Sora

  • ১৯৬৬ — ELIZA: Joseph Weizenbaum, MIT। প্রথম chatbot — pattern matching দিয়ে। কিন্তু "বুঝত" না কিছু।
  • ২০১৩ — Word2Vec: Mikolov et al., Google। শব্দের ভেক্টর representation — generative নয়, কিন্তু ভিত্তি।
  • ২০১৪ — VAE ও GAN: Kingma & Welling-এর VAE, Goodfellow-এর GAN। প্রথম "deep" generative model।
  • ২০১৭ — Transformer: "Attention is All You Need", Vaswani et al., Google। আজকের সব LLM-এর ভিত্তি।
  • ২০১৮-২০২০ — GPT-1, 2, 3: OpenAI। Scaling law প্রমাণ — বড় মডেল মানে বেশি ক্ষমতা।
  • ২০২১ — DALL-E: OpenAI। প্রথমবার text → image generation মূলধারায়।
  • ২০২২ — Stable Diffusion ও ChatGPT: open-source diffusion + RLHF-এর প্রথম viral product। ৫ দিনে ১ মিলিয়ন ব্যবহারকারী।
  • ২০২৩ — GPT-4, Llama 2, Claude 2: multimodal, open-weight, AI assistant — সব mainstream।
  • ২০২৪ — Sora, Claude 3, Gemini 1.5: video generation, ১M+ context, agentic AI।
  • ২০২৫-২০২৬ — Reasoning models, Computer use, Multimodal agents: AI এখন শুধু content তৈরি করে না — কাজও করে।

৪ · Generative AI-র গাণিতিক হৃদয়

যেকোনো generative model-এর কেন্দ্রে একটি চিন্তা — ডেটার distributionProbability Distributionএকটি function যা প্রতিটি possible value-কে প্রবাবিলিটি বরাদ্দ করে। যেমন বাংলাদেশের প্রাপ্তবয়স্কদের উচ্চতার distribution — গড় ১৬৫ সেমি, std ৮ সেমি (প্রায়)। $P(x)$ শেখা, তারপর সেখান থেকে নতুন sample $x \sim P(x)$ তোলা।

"$x$" কী? — এটা ডেটার type-এর উপর নির্ভর। ছবির জন্য $x$ হলো $H \times W \times 3$ পিক্সেলের ভেক্টর। লেখার জন্য $x$ হলো token sequence। অডিওর জন্য $x$ হলো waveform sample।

একটি ৫১২×৫১২ RGB ছবির জন্য $x \in \mathbb{R}^{786{,}432}$। এই ৭ লক্ষ-মাত্রিক space-এ সম্ভাব্য সব ছবির মধ্যে — শুধু একটি ক্ষুদ্র manifold-এ "বাস্তব" ছবি থাকে। Generative model-এর কাজ — সেই manifold শেখা।

একটি ৫১২×৫১২ RGB ছবিতে প্রতি pixel-এ ২৫৬ মান হলে total ছবি $256^{786432}$। এর ৯৯.৯৯৯…% হলো random noise। মাত্র এক tiny অংশে "বাস্তব" ছবি — মুখ, প্রকৃতি, বস্তু। Generative model এই tiny অংশ চিনে।

৫ · "কেন এখন" — তিনটি বিপ্লব

Neural network-এর ধারণা ১৯৪৩-এর। তবু generative AI-র explosion ২০২০-এর পর। কেন? — তিনটি বিপ্লব একসাথে ঘটেছে।

  • (১) Compute বিপ্লব: NVIDIA-র CUDA (২০০৭), GPU training (২০১২ AlexNet), TPU (২০১৬), H100 (২০২২)। GPT-3 train করতে লেগেছে ~৩,১৪০ petaflop-day — যা ১৯৯০-এর সব super-computer combined-এর থেকেও বেশি।
  • (২) Data বিপ্লব: Common Crawl, Wikipedia, GitHub, LAION-5B (৫.৮ বিলিয়ন image-text pair)। internet-scale data — ১৯৯০-এ অকল্পনীয়।
  • (৩) Architecture বিপ্লব: Transformer (২০১৭) — attention mechanism RNN-এর সব দুর্বলতা সরিয়ে দিল। parallel training, long-context, scalable।

এই তিনের সমন্বয়ে — scaling law আবিষ্কৃত হলো (Kaplan et al., ২০২০): মডেলের size ও data বাড়ালে — performance predictable rate-এ বাড়ে। তাই কোম্পানিগুলো কোটি-শতকোটি ডলার ঢালছে — কারণ ROI calculable।

Generative AI — কী তৈরি করে P(x) → sample x ~ P(x) Generative AI 📝 Text GPT-4, Claude, Gemini 🎨 Image DALL-E, SD, Midjourney 🔊 Audio ElevenLabs, MusicLM 🎬 Video Sora, Veo, Runway 💻 Code Copilot, Cursor 🧊 3D / Protein NeRF, AlphaFold
Generative AI ৬ modality জুড়ে কাজ করে — সবার underlying গণিত একই: distribution learning + sampling।

৬ · একটি সরল উদাহরণ — Python-এ

একটি ১-D Gaussian distribution থেকে নতুন sample তৈরি — এটাই generative model-এর সবচেয়ে সরল রূপ।

Python · NumPy
import numpy as np

# ধরা যাক "বাংলাদেশের প্রাপ্তবয়স্কদের উচ্চতা" — Gaussian
# গড় ১৬৫ সেমি, std ৮ সেমি (আনুমানিক)
true_mean = 165.0
true_std = 8.0

# ৫০০ জনের ডেটা সংগ্রহ — training data
data = np.random.normal(true_mean, true_std, size=500)

# জেনারেটিভ মডেল — মাত্র ২টি parameter শিখুন
mu_hat = data.mean()
sigma_hat = data.std()
print(f"শিখলাম: mu={mu_hat:.2f}, sigma={sigma_hat:.2f}")

# নতুন "মানুষ" তৈরি — generation
new_people = np.random.normal(mu_hat, sigma_hat, size=10)
print("নতুন ১০ জনের উচ্চতা:", np.round(new_people, 1))

    
৫০০ জনের ডেটা থেকে মডেল ২টি সংখ্যা শিখল — তারপর অসীম "নতুন মানুষ" তৈরি করতে পারে। এটাই generative AI-র সারমর্ম। Stable Diffusion-এ পার্থক্য শুধু — distribution অনেক জটিল, parameter ১ বিলিয়ন+, কিন্তু idea একই।

৭ · Generative AI কোথায় কাজে লাগছে

  • Content creation: Daraz-এর product description, news article, marketing copy — সবই AI-generated হচ্ছে।
  • Code: GitHub Copilot — Stack Overflow-এর ৫২% developer ব্যবহার করেন (২০২৪ survey)।
  • Education: Khan Academy-র Khanmigo, Duolingo Max — personalized tutor।
  • Healthcare: AlphaFold (২০২১, DeepMind) — ২০০ মিলিয়ন protein structure predict করেছে; drug discovery accelerate করছে।
  • Bangladesh-এ: Pathao-র customer support chatbot, Daraz-এর AI search, bKash-এর fraud detection — সবখানেই generative components।
Generative AI শক্তিশালী, কিন্তু perfect নয় — hallucination, bias, copyright issue, deepfake — সব real concern। পরের পাঠগুলোতে এই trade-off নিয়ে বিস্তারিত আলোচনা করব।

ভাবনার প্রশ্ন

প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।

প্র ০১ ChatGPT যখন একটি কবিতা লেখে — সেটি কি "সৃজনশীলতা" নাকি "memorization"? Stochastic Parrot তর্ক কী, এবং এর দু'দিকে যুক্তি কী?

এই প্রশ্ন AI-র দার্শনিক ভিত্তি ছুঁয়ে যায়। ২০২১-এ Emily Bender, Timnit Gebru, Margaret Mitchell, Angelina McMillan-Major-র বিখ্যাত পেপার "On the Dangers of Stochastic Parrots" — এই বিতর্কের মূলে।

Stochastic Parrot তর্ক (against creativity):

  • LLM শুধু training data-র statistical pattern reproduce করে — অর্থ বুঝে না।
  • "Parrot" — তোতাপাখির মতো শব্দ পুনরাবৃত্তি; "stochastic" — কিছুটা random।
  • Memorization vs generalization — সীমা অস্পষ্ট। GPT-3 training data-র ৪০% verbatim recall করতে পারে (Carlini et al., ২০২২)।
  • "নতুন" কবিতা প্রায়ই ১০,০০০ existing কবিতার re-mix — original idea কোথায়?
  • Embodied experience নেই — বৃষ্টি, ক্ষুধা, ভালোবাসা feel করেনি।

Pro-creativity তর্ক:

  • মানুষের সৃজনশীলতাও existing concept-এর recombination — Picasso বলেছিলেন "Good artists copy, great artists steal।"
  • Emergent abilities — GPT-4 এমন task করে যা training-এ explicitly শেখানো হয়নি (chain-of-thought, multi-step reasoning)।
  • Definition of creativity — যদি output novel + valuable হয়, source matters না।
  • Empirical: GPT-4-র poetry MIT panel "human-level"-এ rate করেছে (ব্লাইন্ড টেস্ট-এ)।

মধ্যপন্থী অবস্থান:

  • "Creativity" একটি spectrum — pure memorization থেকে true novelty পর্যন্ত। LLM সম্ভবত মাঝামাঝি — interpolation ভালো, extrapolation দুর্বল।
  • "Understanding" আলাদা প্রশ্ন — Searle-র Chinese Room argument এখানে relevant। Behavior সঠিক, কিন্তু "experience" আছে কি?
  • Practical সিদ্ধান্ত: AI-generated poetry-কে "co-creation" বলা ভালো — মানুষ prompt করেন, AI execute করে।

Bangladesh-এর প্রসঙ্গে: রবীন্দ্রনাথ-নজরুল-জীবনানন্দ-র শৈলীতে AI কবিতা লিখলে — সেটা কি plagiarism, পরিবেশনা, না নতুন art form? কপিরাইট আইন এখনো clear নয়। এটা জরুরি সাংস্কৃতিক ও আইনি প্রশ্ন।

মূল উপলব্ধি: "Creativity" শব্দটাই complicated। AI-র সাথে আমরা creativity-কে নতুনভাবে সংজ্ঞায়িত করতে বাধ্য হচ্ছি — এটাই এই যুগের সবচেয়ে গভীর philosophical contribution।

প্র ০২ "Scaling law" বলে — মডেল বড় করলে performance বাড়ে। কিন্তু এর সীমা কোথায়? GPT-5, GPT-6 কি অবিরাম বাড়তেই থাকবে — নাকি plateau আসবে?

Kaplan et al. (২০২০) ও Chinchilla paper (Hoffmann et al., ২০২২) scaling law-কে precise করেছে। Performance loss = $L = a \cdot N^{-\alpha} + b \cdot D^{-\beta} + c$ — যেখানে $N$ parameter count, $D$ data size, $\alpha, \beta \approx 0.3$।

Scaling-এর favor-এ যুক্তি:

  • ২০১৮ থেকে ২০২৪ — প্রতিটি new generation predictably better। GPT-3 → GPT-4 → Claude 3.5 → o1 → o3।
  • Emergent abilities — কিছু ক্ষমতা মডেল $10^{22}$ FLOP-এর পরে হঠাৎ আসে (যেমন arithmetic, theory of mind)।
  • DeepMind, OpenAI, Anthropic-এর internal projection — অন্তত ২০২৭ পর্যন্ত scaling continue।

সীমার যুক্তি:

  • Data wall: Internet-এ মানের text সীমিত — Villalobos et al. (২০২৪) estimate করেছেন ২০২৬-২০২৮-এর মধ্যে high-quality text ফুরাবে।
  • Compute cost: GPT-4 train-এ ~$1B; GPT-5 হয়তো $10B; GPT-6 $100B — অর্থনৈতিক সীমা।
  • Energy: ১ GW datacenter — একটি ছোট শহরের সমান consumption। Microsoft Three Mile Island reactor revive করছে AI-র জন্য।
  • Diminishing returns: Loss exponentially decrease হলে — capability linearly বাড়ে। ১০x compute = মাত্র marginal improvement শেষে।
  • Algorithmic ceiling: Transformer-এর fundamental limit আছে — context length, reasoning depth।

Plateau-এর pretender — তিন ভিন্ন path:

  • Synthetic data: Self-play, AI-generated training (যেমন Phi models)। কিন্তু "model collapse" risk — Shumailov et al. (২০২৪)।
  • Inference-time compute: o1, o3-এর approach — train-time-এ কম, inference-এ chain-of-thought দিয়ে compute। নতুন scaling axis।
  • Multimodal data: Video — internet-এ আরও ১০০x text-equivalent data; physical world data via robotics।

আমার মূল্যায়ন: ২০২৫-২০২৮ — text-only scaling ধীর হবে, কিন্তু (১) inference compute, (২) multimodal data, (৩) better architectures (Mamba, Mixture-of-Experts) — মিলিয়ে progress চলবে। "GPT-X" নামের চেয়ে "AI agent" গুরুত্বপূর্ণ হবে — যেখানে multiple models + tools একসাথে কাজ করে।

মূল উপলব্ধি: Scaling একটি path — একমাত্র না। AI progress = scaling + algorithm + data + compute + architecture. কোনো একটি plateau মানে অন্যগুলো নতুন avenue।

প্র ০৩ Generative AI বাংলাদেশের জন্য কী সুযোগ ও challenge আনছে? Daraz, Pathao, bKash, education sector — কোথায় সবচেয়ে বড় impact হবে?

বাংলাদেশের ১৭ কোটি জনসংখ্যা, smartphone penetration ~৫৫%, এবং দ্রুত বর্ধনশীল digital economy — generative AI-র জন্য বিশাল opportunity।

সুযোগ — sector-by-sector:

  • E-commerce (Daraz, Chaldal, Foodpanda): Bangla-aware product description auto-generation, customer service chatbot, personalized recommendation। বর্তমানে ৩০-৪০% support tickets auto-resolve হচ্ছে।
  • Fintech (bKash, Nagad, Rocket): Fraud detection, voice-based transaction (illiterate users-এর জন্য game-changer), credit scoring (যাদের traditional credit history নেই)।
  • Ride-sharing (Pathao, Uber): Demand prediction, dynamic pricing, driver-rider matching, accident report auto-generation।
  • Education: 10 Minute School, Shikho — Bangla AI tutor। SSC/HSC student-এর জন্য personalized learning। গ্রামীণ শিক্ষায় বিপ্লব সম্ভাবনা।
  • Agriculture: Krishi Bank-এর সাথে AI advisor — কৃষককে Bangla voice-এ ফসলের পরামর্শ; satellite imagery থেকে yield prediction।
  • Healthcare: Praava Health, Doctorola — symptom checker, prescription analysis, telemedicine। doctor:patient ratio ১:১৫০০ — AI gap পূরণ করতে পারে।
  • Government: Land record, passport, NID — Bangla document processing, citizen query chatbot।
  • BPO/IT export: বাংলাদেশের $1B+ IT export — AI-augmented developer-রা ৩-৫x productive। outsourcing market বাঁচানোর চাবিকাঠি।

Challenge:

  • Bangla data scarcity: English-এর তুলনায় Bangla pretraining data ১,০০০x কম। mBERT, BLOOM, BanglaBERT সাহায্য করে, কিন্তু GPT-4 quality-এ Bangla LLM এখনো নেই।
  • Compute infrastructure: বাংলাদেশে কোনো large-scale GPU cluster নেই। সব training cloud-এ — dollar drain।
  • Skill gap: ML engineer ~৫,০০০ মাত্র (estimate)। ভারত-পাকিস্তানের তুলনায় কম।
  • Job displacement: Call center (~৫০,০০০ jobs), data entry, content writing — সবচেয়ে vulnerable। reskilling ছাড়া বিপদ।
  • Misinformation: AI-generated deepfake, fake news — election ও social harmony-র জন্য risk। সাইবার নিরাপত্তা আইন এখনো catch-up করেনি।
  • Cultural alignment: Western-trained model বাঙালি culture, religion, sensitivities বুঝে না — সরাসরি deploy করলে friction।
  • Digital divide: ৪৫% population এখনো smartphone-হীন। AI revolution তাদের বাদ দিয়ে চললে inequality বাড়বে।

সবচেয়ে বড় impact-এর prediction:

  1. শিক্ষা — কারণ শিক্ষকের ঘাটতি সবচেয়ে বেশি, AI tutor scalable।
  2. কৃষি — কারণ ৪০% কর্মসংস্থান, smartphone-based AI advisor হাইপার-লোকাল হতে পারে।
  3. স্বাস্থ্যসেবা — কারণ urban-rural inequity বড়, telemedicine + AI bridge।

মূল উপলব্ধি: Generative AI বাংলাদেশের জন্য "leapfrog opportunity" — pre-AI infrastructure-এ দুর্বল হওয়া এখন সুবিধা; নতুন সিস্টেম সরাসরি AI-native ডিজাইন হতে পারে। কিন্তু সরকারি নীতি, ডেটা, এবং talent — তিন pillar মজবুত না হলে — শুধু consumer থেকেই থেকে যাবো, builder হবো না।

প্র ০৪ একই Transformer architecture text, image, audio, video, protein — সব generate করতে পারে। এটা কি "general intelligence"-এর ইঙ্গিত? নাকি বিভ্রম? কেন একই architecture কাজ করে?

এটা ২০২৪-এর সবচেয়ে গভীর observation: Transformer (২০১৭, NLP-র জন্য) — এখন protein folding (AlphaFold), image (DiT, MaskGIT), audio (AudioLM), video (Sora), robotics (RT-2), ও math (AlphaProof) — সবখানে SOTA। এটা accident না।

কেন একই architecture কাজ করে — তিনটি ব্যাখ্যা:

  • (১) Sequence-as-universal: যেকোনো ডেটা সিকোয়েন্সে রূপান্তরিত করা যায় — text token, image patch (ViT), audio frame, video token-cube, amino acid। Transformer sequence-modeling-এর universal tool।
  • (২) Attention = soft retrieval: Attention mechanism = সব token-এর সাথে সব token-এর interaction। এটি "associative memory"-র efficient approximation। মস্তিষ্কে যেমন memory + attention combine — Transformer-এ একই।
  • (৩) Inductive bias কম: CNN-এ "translation invariance" hardcoded; RNN-এ "sequential order"। Transformer almost কোনো prior না দেয় — শুধু data থেকে শেখে। Bitter Lesson (Sutton, ২০১৯): "compute + data সবসময় hand-crafted bias-কে হারায়।"

"General intelligence" তর্ক — pro:

  • একই weights ভিন্ন domain-এ transfer (Gato, ২০২২ — DeepMind)।
  • Emergent reasoning — chain-of-thought, tool use, planning।
  • Cross-modal understanding — GPT-4V image দেখে বাংলায় explain করে।
  • Few-shot adaptation — 5টি example-এ নতুন task শিখে।

"General intelligence" তর্ক — con:

  • Transformer trivial physical reasoning ফেইল করে — "একটা গ্লাস টেবিলে রাখলে কী হবে?" — context ছাড়া বুঝে না।
  • Long-horizon planning দুর্বল — chess, go-তে dedicated systems আজও জিতে।
  • Sample inefficiency — মানব শিশু ১০টি ছবি দেখে বিড়াল চিনে; AI-র লাগে কোটি।
  • No continual learning — train শেষে frozen; নতুন তথ্যে adapt করতে retrain।
  • Embodiment-হীনতা — ভৌত জগতের intuition নেই (যদিও robotics-এ আসছে)।

একটি deeper hypothesis — "Platonic Representation":

  • Huh et al. (২০২৪, MIT) — দাবি যে large model-গুলো ভিন্ন modality থেকে শিখে একই underlying representation-এ converge করছে।
  • Idea: বাস্তবতার একটাই geometric structure আছে — image, text, audio সব সেই structure-এর projection।
  • সুতরাং একই architecture কাজ করে — কারণ ভিন্ন data-তে একই pattern hidden।

Bangladesh-এর প্রসঙ্গে: এই universality মানে — আমাদের পৃথক "Bangla model" build করতে হবে না। Multilingual large model-এ Bangla data যোগ করলেই কাজ করে। তবে cultural alignment ও fine-tuning প্রয়োজন।

মূল উপলব্ধি: Transformer "general" — তবে general intelligence নয়। এটি general "pattern learning machine" — সঠিক data + objective পেলে যেকোনো modality শেখে। এটাই AGI-র দিকে প্রথম convincing step — তবে শেষ step নয়। অনেক missing piece আছে — embodiment, continual learning, true reasoning, world model।

অনুশীলন

  1. চিনুন: নিচের প্রতিটি AI সিস্টেমকে generative, discriminative, বা both-এ চিহ্নিত করুন:
    • (ক) Gmail-এর spam filter
    • (খ) ChatGPT
    • (গ) Tesla-র autopilot
    • (ঘ) DALL-E
    • (ঙ) Bangladesh Bank-এর fraud detection
    • (ক) Discriminative — $P(\text{spam}|\text{email})$।
    • (খ) Generative — $P(\text{token}_{t+1}|\text{previous})$।
    • (গ) Both — perception part discriminative (object detection), planning generative (trajectory generation)।
    • (ঘ) Generative — $P(\text{image}|\text{text})$।
    • (ঙ) Discriminative — $P(\text{fraud}|\text{transaction})$।
  2. NumPy-তে চেষ্টা: ১-D Gaussian থেকে নতুন sample তৈরি করুন। Bangladesh-এর প্রাপ্তবয়স্ক পুরুষের গড় উচ্চতা ১৬৫ সেমি, std ৭ সেমি ধরে — ১,০০০ "নতুন মানুষ" generate করে histogram আঁকুন।
    import numpy as np
    import matplotlib.pyplot as plt
    
    samples = np.random.normal(165, 7, size=1000)
    plt.hist(samples, bins=30, color='#7c3aed', edgecolor='white')
    plt.xlabel('উচ্চতা (cm)')
    plt.ylabel('সংখ্যা')
    plt.title('১,০০০ generated মানুষের উচ্চতা')
    plt.show()
    print(f"Mean: {samples.mean():.2f}, Std: {samples.std():.2f}")
  3. ভাবুন: বাংলাদেশের কোন একটি সমস্যা — যেখানে generative AI বিপ্লব আনতে পারে কিন্তু এখনো আসেনি? অন্তত ৩টি লিখুন এবং কেন এই gap তা ব্যাখ্যা করুন।

    সম্ভাব্য উত্তর (অনেক উত্তর হতে পারে):

    • Bangla speech-to-text: dialect (চাটগাঁইয়া, সিলেটি) সহ। Gap: dialect-labeled audio dataset নেই।
    • Government form auto-fill: Land record, passport application। Gap: digitization কম, OCR-এ Bangla weak।
    • Krishi advisor: hyper-local farming guidance। Gap: agronomist-এর data + voice interaction না থাকা।
    • Mental health support: Bangla-aware therapy chatbot। Gap: ethical guidance, clinical validation।

    Common theme: data + infrastructure + cultural alignment — এই তিনের সমন্বয় না থাকায় opportunity-গুলো untapped।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

কোড রানার কাজ না করলে? ব্রাউজারে কাজ না করলে Google Colab ব্যবহার করুন — Google-এর ফ্রি অনলাইন Python পরিবেশ, শুধু Gmail অ্যাকাউন্ট লাগে।
পূর্ববর্তী পৃষ্ঠা
কোর্স ভূমিকা