পাঠ ২০ · ৩০-এর মধ্যে · মডিউল ২ সমাপ্তি
Home / AI Courses / AI Foundations / মডিউল ২ পর্যালোচনা

মডিউল ২ পর্যালোচনা ও কুইজ

Module 2 review & quiz
১০ মিনিট ১০ প্রশ্নের কুইজ মডিউল সমাপ্তি

এই পাঠে যা করবেন

  • মডিউল ২-এর ৯টি পাঠের গণিত একনজরে দেখবেন
  • ১০টি প্রশ্নের কুইজে নিজেকে পরীক্ষা করবেন
  • মডিউল ৩ — AI-চিন্তা — শুরু করার জন্য প্রস্তুত হবেন

১ · যা আপনি ইতিমধ্যে শিখেছেন

গণিত এই কোর্সের সবচেয়ে কঠিন অংশ। অভিনন্দন — এই অংশ পার করেছেন। নিচের কার্ডগুলো একেকটি পাঠের সারসংক্ষেপ — কোথাও কনফিউজ লাগলে সরাসরি সেই পাঠে ফিরে যান।

L11

ভেক্টর

সংখ্যার সাজানো তালিকা — তীরও বটে। যোগ, স্কেলার-গুণ, দৈর্ঘ্য (norm)।

L12

ম্যাট্রিক্স

সংখ্যার ২-মাত্রিক টেবিল। ম্যাট্রিক্স গুণ ($A @ B$) — AI-এর হৃদয়।

L13

ডেরিভেটিভDerivativeএকটি function-এর instantaneous rate of change — graph-এ tangent slope. backpropagation-এর core.

পরিবর্তনের গণিত — তাৎক্ষণিক ঢাল। Power rule, ও কয়েকটি স্ট্যান্ডার্ড সূত্র।

L14

গ্রেডিয়েন্টGradient (∇L)একটি multivariate function-এর সব partial derivative-এর vector. সবচেয়ে দ্রুত বৃদ্ধির দিক বলে।

আংশিক ডেরিভেটিভের ভেক্টর। সবচেয়ে দ্রুত বৃদ্ধির দিক।

L15

গ্রেডিয়েন্ট ডিসেন্টGradient Descentiterative optimization — gradient-এর বিপরীত দিকে ছোট ছোট step নিয়ে loss minimize. AI-এর সব training-এর backbone.

$w \leftarrow w - \eta \nabla L$। AI-এর শেখার মূল অ্যালগরিদম।

L16

সম্ভাবনার মূল

Sample space, event, conditional probabilityConditional Probability$P(A \mid B)$ — $B$ ঘটেছে এই শর্তে $A$-এর সম্ভাবনা। Bayes-এর ভিত্তি।, independenceIndependenceদু'টি event স্বাধীন যদি একটির ঘটা অন্যটির সম্ভাবনাকে প্রভাবিত না করে।.

L17

বিতরণProbability Distributionএকটি random variable-এর কোন কোন মান কতটা সম্ভাব্য — তার সম্পূর্ণ চিত্র। যেমন Gaussian, Bernoulli.

Bernoulli, Binomial, Uniform, Gaussian. ৬৮-৯৫-৯৯.৭ নিয়ম।

L18

প্রত্যাশাExpectation E[X]একটি random variable-এর গড় মান, probability দিয়ে weighted. অসংখ্য বার পরীক্ষায় গড়ে যা আসবে। ও ভেরিয়েন্সVariance Var[X]মানগুলো গড় থেকে কতটা ছড়িয়ে আছে — গড় থেকে বর্গ-দূরত্বের প্রত্যাশা।

$E[X]$, $\text{Var}[X]$, $\sigma$, covariance ও correlation.

L19

Bayes-এর উপপাদ্যBayes' Theorem$P(A \mid B) = P(B \mid A) P(A) / P(B)$ — নতুন প্রমাণ পেলে আগের বিশ্বাস update করার সূত্র।

Prior + Likelihood → Posterior. মেডিকেল ও spam-এর ক্লাসিক উদাহরণ।

২ · মডিউলের মূল উপলব্ধি — ৬টি বাক্যে

  • ভেক্টর = সংখ্যার তালিকা — AI-এ ছবি, লেখা, কণ্ঠ — সব ভেক্টরে।
  • ম্যাট্রিক্স গুণ = AI-এর প্রতিটি স্তরের ভিত্তি। GPU দ্রুত এই কাজে।
  • গ্রেডিয়েন্ট = "loss কীভাবে বাড়ে" — তার বিপরীতে গেলে loss কমে।
  • Gradient Descent = ছোট ছোট ধাপে loss minimize — AI-এর শেখার মূল।
  • সম্ভাবনা ও বিতরণ — অনিশ্চয়তা পরিমাপ। Gaussian সর্বত্র।
  • Bayes-এর উপপাদ্য — নতুন প্রমাণে বিশ্বাস আপডেট। Spam filter, মেডিকেল, ক্লাসিফিকেশন — সর্বত্র।
আজকের জাদুমন্ত্র

Linear algebra (vector + matrix) দিয়ে ডেটা ধরা। Calculus (gradient) দিয়ে loss কমানো। Probability দিয়ে অনিশ্চয়তা সামলানো।
— এই তিনটিই AI-এর গণিতের সম্পূর্ণ ভিত্তি।

মডিউল ২ — AI-এর গণিতের তিন স্তম্ভ Linear Algebra · Calculus · Probability 📐 Linear Algebra "data ধরা" L11 · ভেক্টর L12 · ম্যাট্রিক্স ছবি/লেখা/কণ্ঠ → সব ভেক্টরে Matrix multiply = DL-এর hardware কাজ ∇ Calculus "loss কমানো" L13 · ডেরিভেটিভ L14 · গ্রেডিয়েন্ট L15 · GD w ← w − η∇L AI শেখার সূত্র backprop = chain rule 🎲 Probability "অনিশ্চয়তা" L16 · মূল L17 · বিতরণ L18 · E, Var L19 · Bayes Softmax output spam filter, RAG decision under risk ⚡ AI = Algebra × Calculus × Probability তিনটি একসাথে — modern AI সম্ভব → মডিউল ৩: Information Theory · Optimization · Statistics · ML
তিনটি স্তম্ভ একসাথে — AI-এর গণিত সম্পূর্ণ। মডিউল ৩-এ practical AI.

মডিউল ২ — চূড়ান্ত কুইজ (১০ প্রশ্ন)

মডিউল ২-এর সব ধারণা থেকে। তাৎক্ষণিক ফলাফল পাবেন।

প্র ০১ ভেক্টর $(3, 4)$-এর দৈর্ঘ্য কত?
$\sqrt{9 + 16} = 5$।
প্র ০২ NumPy-তে ম্যাট্রিক্স গুণের সঠিক operator?
* উপাদান-উপাদান। @ বা matmul = প্রকৃত ম্যাট্রিক্স গুণ।
প্র ০৩ $f(x) = 5x^4$-এর ডেরিভেটিভ?
Power rule: $5 \cdot 4 \cdot x^{4-1} = 20x^3$।
প্র ০৪ $f(x, y) = x^2 + 3y$-এর $\partial f/\partial y$ কত?
$x$ ধ্রুব ধরে $y$-এর সাপেক্ষে: $0 + 3 = 3$।
প্র ০৫ Gradient Descent-এর update rule?
গ্রেডিয়েন্টের বিপরীত দিকে যাও — তাই ঋণ চিহ্ন।
প্র ০৬ Learning rate ($\eta$) খুব বড় হলে?
বড় ধাপ এক পাশ থেকে আরেক পাশে চলে যায় — overshoot হয়।
প্র ০৭ Gaussian বিতরণে ৯৫% sample কোথায়?
৬৮-৯৫-৯৯.৭ নিয়ম — ২σ-এ ৯৫%।
প্র ০৮ একটি ভারসাম্যপূর্ণ ছক্কার expectation?
সব ৬ মান সমান-সম্ভাব্য। গড় = $\frac{1+...+6}{6} = 3.5$।
প্র ০৯ Bayes-এ $P(B \mid A)$-কে কী বলে?
$A$ সত্য হলে $B$ দেখার সম্ভাবনা — likelihood.
প্র ১০ ৯৯% সঠিক একটি বিরল-রোগ পরীক্ষা পজিটিভ এসেছে — তবু আপনার রোগ থাকার সম্ভাবনা কম কেন?
Base rate fallacy — prior ছাড়া সিদ্ধান্ত ভুল হয়।

মডিউল-ব্যাপী চিন্তার প্রশ্ন

একটি মডিউল শুধু গণিত নয় — connections. নিচের প্রশ্নগুলো ৯ পাঠকে একসাথে বাঁধে।

প্র ০১ ChatGPT-এ "Bangladesh" শব্দটি লিখলে — model-এর ভেতরে গণিতগতভাবে কী ঘটে? Module 2-এর কোন কোন ধারণা প্রয়োগ হয়?

এই প্রশ্ন — Module 2-এর সব ধারণাকে একসাথে কাজে লাগায়। এক প্রম্পট-এর গভীরে।

ধাপ ১ — Tokenization (পাঠ ১১):

  • "Bangladesh" → tokens (subwords)। GPT-৪-এ প্রায় "Bang" + "lad" + "esh" বা সম্পূর্ণ "Bangladesh"।
  • Tokens → integer IDs (vocab index)।
  • Integer → vector via embedding lookup. প্রতিটি token = 12,288-D vector.

ধাপ ২ — Position encoding (পাঠ ১১):

  • প্রতিটি position-এ একটি vector যোগ — order বুঝতে।
  • RoPE বা sinusoidal — vector arithmetic.

ধাপ ৩ — Self-attention (পাঠ ১২):

  • Q, K, V matrices তৈরি — সব matrix multiply.
  • $\text{softmax}(QK^T/\sqrt{d}) V$ — attention.
  • 96+ heads × 96+ layers — কোটি কোটি matrix multiplications.

ধাপ ৪ — Forward pass (পাঠ ১২):

  • প্রতিটি layer: matrix multiply + non-linearity (ReLU/GELU)।
  • FFN: $y = W_2 \cdot \text{GELU}(W_1 x + b_1) + b_2$।
  • Layer norm, residual connections.

ধাপ ৫ — Output probabilities (পাঠ ১৬, ১৭):

  • Final hidden → vocab-size logits ($W_{out}$ multiply)।
  • Softmax → probability distribution over vocab.
  • Categorical distribution — পাঠ ১৭-এর extension.

ধাপ ৬ — Sampling (পাঠ ১৭, ১৯):

  • Temperature-scaled softmax → sample.
  • Top-k, top-p filtering — Bayesian-flavored decision.
  • Next token chosen.

ধাপ ৭ — Training (পাঠ ১৩-১৫):

  • Cross-entropy loss = -log P(true_token)।
  • Backprop = chain rule = derivatives across all layers.
  • Gradient computed for ১.৭T parameters.
  • AdamW step: $w \leftarrow w - \eta \cdot \hat{m}/\sqrt{\hat{v}}$।

ধাপ ৮ — Probabilistic interpretation (পাঠ ১৬-১৯):

  • Model = $P(\text{next} | \text{context})$ estimator.
  • Implicit Bayesian: prior = training data distribution; likelihood = current input pattern.
  • Hallucination = wrong $P$ assigned to non-factual continuation.

সারসংক্ষেপ — কোন পাঠ কোথায়:

  • Vector (L11): tokens, embeddings, hidden states.
  • Matrix (L12): প্রতিটি layer-এর Q, K, V, FFN — সবই matrix mult.
  • Derivative (L13): প্রতিটি operation-এর local gradient.
  • Gradient (L14): প্রতিটি parameter-এর সাপেক্ষে loss-এর partial.
  • GD (L15): training-এর প্রতিটি step.
  • Probability (L16-17): output distribution.
  • Expectation (L18): training loss = expected cross-entropy.
  • Bayes (L19): generation = posterior sampling.

মূল উপলব্ধি: ChatGPT-এর ভেতরে কোনো magic নেই। Linear algebra + Calculus + Probability — Module 2-এর সব। শুধু scale বিশাল।

প্র ০২ মডিউল ২-এ যে গণিত শিখলেন — নিজে একটি linear regression model implement করুন (NumPy দিয়ে), ৫০-এর কম লাইন। এটা module 2-এর "graduation project"।

এটাই আসল পরীক্ষা — সব ধারণা একসাথে practical-এ প্রয়োগ।

import numpy as np

# 1. ডেটা — y = 3x + 2 + noise (পাঠ ১৭ — Gaussian noise)
np.random.seed(42)
N = 100
X = np.random.uniform(0, 10, N)              # পাঠ ১১: vector
y_true = 3 * X + 2
y = y_true + np.random.normal(0, 1.5, N)     # noise = Gaussian (পাঠ ১৭)

# 2. Model parameters init (পাঠ ১৭ — random uniform init)
w, b = np.random.randn(), np.random.randn()  # vector of 2 params
eta = 0.01                                    # learning rate
losses = []

# 3. Training loop — Gradient Descent (পাঠ ১৫)
for epoch in range(500):
    # Forward — matrix-style operation (পাঠ ১২)
    y_hat = w * X + b

    # Loss — MSE (পাঠ ১৮: variance of error)
    error = y_hat - y
    loss = (error ** 2).mean()                # E[(y_hat-y)^2]
    losses.append(loss)

    # Gradients — partial derivatives (পাঠ ১৩, ১৪)
    dw = 2 * (error * X).mean()               # ∂L/∂w
    db = 2 * error.mean()                     # ∂L/∂b

    # Update — w ← w − η ∇L (পাঠ ১৫)
    w -= eta * dw
    b -= eta * db

# 4. Result
print(f"True: y = 3x + 2")
print(f"Learned: y = {w:.3f}x + {b:.3f}")
print(f"Initial loss: {losses[0]:.2f}")
print(f"Final loss: {losses[-1]:.4f}")

প্রত্যাশিত output: $w \approx 3$, $b \approx 2$। Loss ১০-৫০ থেকে ~২ (noise variance)-এ কমে।

প্রতিটি লাইন কোন পাঠ থেকে:

  • Lines 5-9: পাঠ ১১ (vectors), পাঠ ১৭ (Gaussian)।
  • Line 12: পাঠ ১৭ (random init)।
  • Lines 17-19: পাঠ ১২ (broadcasting matrix-like ops)।
  • Lines 21-23: পাঠ ১৮ (mean = expectation)।
  • Lines 25-27: পাঠ ১৩-১৪ (derivatives)।
  • Lines 29-30: পাঠ ১৫ (GD update)।

সম্প্রসারণ অনুশীলন:

  1. Higher dim — multivariate regression (matrix operations)।
  2. Different learning rates — convergence compare.
  3. Regularization যোগ — overfitting দেখা।
  4. Mini-batch SGD — true SGD-এর effect.

মূল উপলব্ধি: এই ৫০ লাইন = Module 2-এর সব। প্রতিটি AI মডেল — শুধু এর scaled-up version. GPT-4 vs এই code: same principles, ১.৭T × parameters.

প্র ০৩ "AI গণিত শক্তিশালী, কিন্তু আমার কোনো গণিতের background নেই" — এই situation-এ Module 2-এর কোনটি minimal essential? কোনটি ছেড়ে দেওয়া যায়?

সব AI engineer-এর math expertise সমান লাগে না। Role-অনুযায়ী prioritize করুন।

Tier 1 — অপরিহার্য (must know):

  • L11 — Vector basics: Embedding বুঝতে, similarity বুঝতে, sklearn/PyTorch debug-এ। NumPy-তে comfortable হওয়া।
  • L16 — Probability basics: Output probabilities বুঝতে, classification metric (precision/recall) বুঝতে।
  • L17 — Distributions (Gaussian): Normal distribution, mean, std — data analysis-এর core.

Tier 2 — ML Engineer / Data Scientist হলে দরকার:

  • L12 — Matrix: Pandas/NumPy daily. DataFrame operations matrix operations.
  • L18 — Expectation/Variance: A/B testing, model comparison, metric interpretation.
  • L19 — Bayes: Naive Bayes, decision-making under uncertainty.

Tier 3 — DL/Research/Custom training হলে দরকার:

  • L13 — Derivative: Loss function design.
  • L14 — Gradient: Custom loss, debugging gradients.
  • L15 — Gradient Descent: Optimizer choice, learning rate tuning.

Role-specific recommendations:

  • AI Application Developer (LLM API user): L11, L16, L17 যথেষ্ট। বাকি optional.
  • Prompt Engineer: L17 (sampling), L19 (probability) — basic level.
  • Data Scientist: All Tier 1 + Tier 2. Tier 3 helpful.
  • ML Engineer: All. DL details handle.
  • Research Scientist: Module 2 + আরও — multivariate calc, optimization theory, measure theory, RL math.

"Math fobia" overcome strategies:

  1. Code first: Math notation না বোঝা পর্যন্ত — code চালান। Numerical intuition develop.
  2. Visual learning: 3Blue1Brown YouTube — gradient, calculus, linear algebra. বাংলায় ABCL TECH-এর ভিডিও।
  3. Just-in-time learning: "এই concept এখন দরকার" — তখন শিখুন। সব আগে না।
  4. Build projects: Theoretical formula vs working code — দ্বিতীয়টি দ্রুত intuition দেয়।
  5. API-first then math: sklearn/PyTorch API দিয়ে result পান — তারপর "কীভাবে কাজ করে" বুঝুন।

"কম math দিয়েও AI সম্ভব?"

  • হ্যাঁ — অনেক practical AI.
  • OpenAI API + prompt engineering = বহু application.
  • HuggingFace + sklearn = traditional ML.
  • কিন্তু — debugging, optimization, novel problems — math দরকার।

মূল উপলব্ধি: Module 2 সম্পূর্ণ মুখস্থ লাগে না। Goal-অনুযায়ী prioritize করুন। Math = tool, না identity.

আত্ম-পর্যালোচনা

  1. লিখুন: মডিউল ২ থেকে আপনার সবচেয়ে অবাক করা গণিত উপলব্ধি কোনটি? কেন?

    সাধারণ "ah-ha" মুহূর্ত:

    • "AI = matrix multiply" — magic না, simple algebra.
    • "৯৯% accurate test = ১৬.৭% confidence" — Bayes-এর paradox.
    • "Gradient = steepest direction" — geometric intuition.
    • "CLT — সব Gaussian হয়" — গণিতের জাদু।
    • "Naive Bayes কাজ করে যদিও assumption ভুল" — pragmatism > purity.
  2. সংযোগ করুন: AI কীভাবে শেখে — সেটা ৩-৪ বাক্যে নিজে ব্যাখ্যা করুন। Vector, Gradient ও Loss — তিনটি শব্দ ব্যবহার করুন।

    উদাহরণ ভাল উত্তর:

    "AI ডেটাকে vector-এ রূপান্তর করে। Model parameters একটি বিশাল vector. সঠিক উত্তর থেকে কতদূর — সেটা loss নামে একটি একক সংখ্যা। Loss-এর gradient (parameter-এর সাপেক্ষে) বলে কোন দিকে যেতে হবে। Loss কমাতে — বিপরীতে ছোট ধাপ। কোটি কোটি ধাপ পরে — model ভাল predict করে। এটাই AI-এর শেখা।"

  3. লক্ষ্য: পরের সপ্তাহে প্রতিদিন একটি Python কোড সেল চালান। প্যারামিটার বদলান। কী পরিবর্তন হয় দেখুন।

    সাজেশন routine:

    • দিন ১: পাঠ ১৫-এর GD code. Learning rate ০.০০১ থেকে ২.০ পর্যন্ত try করুন।
    • দিন ২: পাঠ ১৭-এর Gaussian sampling. μ ও σ পরিবর্তন।
    • দিন ৩: পাঠ ১৯-এর Bayes — disease prevalence ১০%, ১%, ০.১%-এ change.
    • দিন ৪: প্র ০২-এর linear regression — features বাড়ান।
    • দিন ৫-৭: একটি real dataset Kaggle থেকে — practice.

    মূল কথা: Code চালান, intuition build করুন। Math papers পরে।

পরবর্তী মডিউল

মডিউল ৩-এ আমরা গণিত থেকে AI-চিন্তায় ফিরে যাব। তথ্য তত্ত্ব, সংখ্যাগত স্থিরতা, পরিসংখ্যানের প্রয়োগ — বাস্তব সমস্যা কীভাবে AI-এর ভাষায় রূপান্তর হয়। ১০টি পাঠে — মডিউল ৩।

আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ

মডিউল ৩-এর জন্য প্রস্তুতি: Math practice continue করুন। কোডিং পরিবেশ চাইলে Google Colab ব্যবহার করুন — Google-এর ফ্রি অনলাইন Python পরিবেশ।
পূর্ববর্তী পাঠ
পাঠ ১৯ · Bayes-এর উপপাদ্য