মডিউল ২ পর্যালোচনা ও কুইজ
এই পাঠে যা করবেন
- মডিউল ২-এর ৯টি পাঠের গণিত একনজরে দেখবেন
- ১০টি প্রশ্নের কুইজে নিজেকে পরীক্ষা করবেন
- মডিউল ৩ — AI-চিন্তা — শুরু করার জন্য প্রস্তুত হবেন
১ · যা আপনি ইতিমধ্যে শিখেছেন
গণিত এই কোর্সের সবচেয়ে কঠিন অংশ। অভিনন্দন — এই অংশ পার করেছেন। নিচের কার্ডগুলো একেকটি পাঠের সারসংক্ষেপ — কোথাও কনফিউজ লাগলে সরাসরি সেই পাঠে ফিরে যান।
ভেক্টর
সংখ্যার সাজানো তালিকা — তীরও বটে। যোগ, স্কেলার-গুণ, দৈর্ঘ্য (norm)।
L12ম্যাট্রিক্স
সংখ্যার ২-মাত্রিক টেবিল। ম্যাট্রিক্স গুণ ($A @ B$) — AI-এর হৃদয়।
L13ডেরিভেটিভDerivativeএকটি function-এর instantaneous rate of change — graph-এ tangent slope. backpropagation-এর core.
পরিবর্তনের গণিত — তাৎক্ষণিক ঢাল। Power rule, ও কয়েকটি স্ট্যান্ডার্ড সূত্র।
L14গ্রেডিয়েন্টGradient (∇L)একটি multivariate function-এর সব partial derivative-এর vector. সবচেয়ে দ্রুত বৃদ্ধির দিক বলে।
আংশিক ডেরিভেটিভের ভেক্টর। সবচেয়ে দ্রুত বৃদ্ধির দিক।
L15গ্রেডিয়েন্ট ডিসেন্টGradient Descentiterative optimization — gradient-এর বিপরীত দিকে ছোট ছোট step নিয়ে loss minimize. AI-এর সব training-এর backbone.
$w \leftarrow w - \eta \nabla L$। AI-এর শেখার মূল অ্যালগরিদম।
L16সম্ভাবনার মূল
Sample space, event, conditional probabilityConditional Probability$P(A \mid B)$ — $B$ ঘটেছে এই শর্তে $A$-এর সম্ভাবনা। Bayes-এর ভিত্তি।, independenceIndependenceদু'টি event স্বাধীন যদি একটির ঘটা অন্যটির সম্ভাবনাকে প্রভাবিত না করে।.
L17বিতরণProbability Distributionএকটি random variable-এর কোন কোন মান কতটা সম্ভাব্য — তার সম্পূর্ণ চিত্র। যেমন Gaussian, Bernoulli.
Bernoulli, Binomial, Uniform, Gaussian. ৬৮-৯৫-৯৯.৭ নিয়ম।
L18প্রত্যাশাExpectation E[X]একটি random variable-এর গড় মান, probability দিয়ে weighted. অসংখ্য বার পরীক্ষায় গড়ে যা আসবে। ও ভেরিয়েন্সVariance Var[X]মানগুলো গড় থেকে কতটা ছড়িয়ে আছে — গড় থেকে বর্গ-দূরত্বের প্রত্যাশা।
$E[X]$, $\text{Var}[X]$, $\sigma$, covariance ও correlation.
L19Bayes-এর উপপাদ্যBayes' Theorem$P(A \mid B) = P(B \mid A) P(A) / P(B)$ — নতুন প্রমাণ পেলে আগের বিশ্বাস update করার সূত্র।
Prior + Likelihood → Posterior. মেডিকেল ও spam-এর ক্লাসিক উদাহরণ।
২ · মডিউলের মূল উপলব্ধি — ৬টি বাক্যে
- ভেক্টর = সংখ্যার তালিকা — AI-এ ছবি, লেখা, কণ্ঠ — সব ভেক্টরে।
- ম্যাট্রিক্স গুণ = AI-এর প্রতিটি স্তরের ভিত্তি। GPU দ্রুত এই কাজে।
- গ্রেডিয়েন্ট = "loss কীভাবে বাড়ে" — তার বিপরীতে গেলে loss কমে।
- Gradient Descent = ছোট ছোট ধাপে loss minimize — AI-এর শেখার মূল।
- সম্ভাবনা ও বিতরণ — অনিশ্চয়তা পরিমাপ। Gaussian সর্বত্র।
- Bayes-এর উপপাদ্য — নতুন প্রমাণে বিশ্বাস আপডেট। Spam filter, মেডিকেল, ক্লাসিফিকেশন — সর্বত্র।
Linear algebra (vector + matrix) দিয়ে ডেটা ধরা। Calculus (gradient) দিয়ে loss কমানো। Probability দিয়ে অনিশ্চয়তা সামলানো।
— এই তিনটিই AI-এর গণিতের সম্পূর্ণ ভিত্তি।
মডিউল ২ — চূড়ান্ত কুইজ (১০ প্রশ্ন)
মডিউল ২-এর সব ধারণা থেকে। তাৎক্ষণিক ফলাফল পাবেন।
* উপাদান-উপাদান। @ বা matmul = প্রকৃত ম্যাট্রিক্স গুণ।মডিউল-ব্যাপী চিন্তার প্রশ্ন
একটি মডিউল শুধু গণিত নয় — connections. নিচের প্রশ্নগুলো ৯ পাঠকে একসাথে বাঁধে।
প্র ০১ ChatGPT-এ "Bangladesh" শব্দটি লিখলে — model-এর ভেতরে গণিতগতভাবে কী ঘটে? Module 2-এর কোন কোন ধারণা প্রয়োগ হয়?
এই প্রশ্ন — Module 2-এর সব ধারণাকে একসাথে কাজে লাগায়। এক প্রম্পট-এর গভীরে।
ধাপ ১ — Tokenization (পাঠ ১১):
- "Bangladesh" → tokens (subwords)। GPT-৪-এ প্রায় "Bang" + "lad" + "esh" বা সম্পূর্ণ "Bangladesh"।
- Tokens → integer IDs (vocab index)।
- Integer → vector via embedding lookup. প্রতিটি token = 12,288-D vector.
ধাপ ২ — Position encoding (পাঠ ১১):
- প্রতিটি position-এ একটি vector যোগ — order বুঝতে।
- RoPE বা sinusoidal — vector arithmetic.
ধাপ ৩ — Self-attention (পাঠ ১২):
- Q, K, V matrices তৈরি — সব matrix multiply.
- $\text{softmax}(QK^T/\sqrt{d}) V$ — attention.
- 96+ heads × 96+ layers — কোটি কোটি matrix multiplications.
ধাপ ৪ — Forward pass (পাঠ ১২):
- প্রতিটি layer: matrix multiply + non-linearity (ReLU/GELU)।
- FFN: $y = W_2 \cdot \text{GELU}(W_1 x + b_1) + b_2$।
- Layer norm, residual connections.
ধাপ ৫ — Output probabilities (পাঠ ১৬, ১৭):
- Final hidden → vocab-size logits ($W_{out}$ multiply)।
- Softmax → probability distribution over vocab.
- Categorical distribution — পাঠ ১৭-এর extension.
ধাপ ৬ — Sampling (পাঠ ১৭, ১৯):
- Temperature-scaled softmax → sample.
- Top-k, top-p filtering — Bayesian-flavored decision.
- Next token chosen.
ধাপ ৭ — Training (পাঠ ১৩-১৫):
- Cross-entropy loss = -log P(true_token)।
- Backprop = chain rule = derivatives across all layers.
- Gradient computed for ১.৭T parameters.
- AdamW step: $w \leftarrow w - \eta \cdot \hat{m}/\sqrt{\hat{v}}$।
ধাপ ৮ — Probabilistic interpretation (পাঠ ১৬-১৯):
- Model = $P(\text{next} | \text{context})$ estimator.
- Implicit Bayesian: prior = training data distribution; likelihood = current input pattern.
- Hallucination = wrong $P$ assigned to non-factual continuation.
সারসংক্ষেপ — কোন পাঠ কোথায়:
- Vector (L11): tokens, embeddings, hidden states.
- Matrix (L12): প্রতিটি layer-এর Q, K, V, FFN — সবই matrix mult.
- Derivative (L13): প্রতিটি operation-এর local gradient.
- Gradient (L14): প্রতিটি parameter-এর সাপেক্ষে loss-এর partial.
- GD (L15): training-এর প্রতিটি step.
- Probability (L16-17): output distribution.
- Expectation (L18): training loss = expected cross-entropy.
- Bayes (L19): generation = posterior sampling.
মূল উপলব্ধি: ChatGPT-এর ভেতরে কোনো magic নেই। Linear algebra + Calculus + Probability — Module 2-এর সব। শুধু scale বিশাল।
প্র ০২ মডিউল ২-এ যে গণিত শিখলেন — নিজে একটি linear regression model implement করুন (NumPy দিয়ে), ৫০-এর কম লাইন। এটা module 2-এর "graduation project"।
এটাই আসল পরীক্ষা — সব ধারণা একসাথে practical-এ প্রয়োগ।
import numpy as np
# 1. ডেটা — y = 3x + 2 + noise (পাঠ ১৭ — Gaussian noise)
np.random.seed(42)
N = 100
X = np.random.uniform(0, 10, N) # পাঠ ১১: vector
y_true = 3 * X + 2
y = y_true + np.random.normal(0, 1.5, N) # noise = Gaussian (পাঠ ১৭)
# 2. Model parameters init (পাঠ ১৭ — random uniform init)
w, b = np.random.randn(), np.random.randn() # vector of 2 params
eta = 0.01 # learning rate
losses = []
# 3. Training loop — Gradient Descent (পাঠ ১৫)
for epoch in range(500):
# Forward — matrix-style operation (পাঠ ১২)
y_hat = w * X + b
# Loss — MSE (পাঠ ১৮: variance of error)
error = y_hat - y
loss = (error ** 2).mean() # E[(y_hat-y)^2]
losses.append(loss)
# Gradients — partial derivatives (পাঠ ১৩, ১৪)
dw = 2 * (error * X).mean() # ∂L/∂w
db = 2 * error.mean() # ∂L/∂b
# Update — w ← w − η ∇L (পাঠ ১৫)
w -= eta * dw
b -= eta * db
# 4. Result
print(f"True: y = 3x + 2")
print(f"Learned: y = {w:.3f}x + {b:.3f}")
print(f"Initial loss: {losses[0]:.2f}")
print(f"Final loss: {losses[-1]:.4f}")
প্রত্যাশিত output: $w \approx 3$, $b \approx 2$। Loss ১০-৫০ থেকে ~২ (noise variance)-এ কমে।
প্রতিটি লাইন কোন পাঠ থেকে:
- Lines 5-9: পাঠ ১১ (vectors), পাঠ ১৭ (Gaussian)।
- Line 12: পাঠ ১৭ (random init)।
- Lines 17-19: পাঠ ১২ (broadcasting matrix-like ops)।
- Lines 21-23: পাঠ ১৮ (mean = expectation)।
- Lines 25-27: পাঠ ১৩-১৪ (derivatives)।
- Lines 29-30: পাঠ ১৫ (GD update)।
সম্প্রসারণ অনুশীলন:
- Higher dim — multivariate regression (matrix operations)।
- Different learning rates — convergence compare.
- Regularization যোগ — overfitting দেখা।
- Mini-batch SGD — true SGD-এর effect.
মূল উপলব্ধি: এই ৫০ লাইন = Module 2-এর সব। প্রতিটি AI মডেল — শুধু এর scaled-up version. GPT-4 vs এই code: same principles, ১.৭T × parameters.
প্র ০৩ "AI গণিত শক্তিশালী, কিন্তু আমার কোনো গণিতের background নেই" — এই situation-এ Module 2-এর কোনটি minimal essential? কোনটি ছেড়ে দেওয়া যায়?
সব AI engineer-এর math expertise সমান লাগে না। Role-অনুযায়ী prioritize করুন।
Tier 1 — অপরিহার্য (must know):
- L11 — Vector basics: Embedding বুঝতে, similarity বুঝতে, sklearn/PyTorch debug-এ। NumPy-তে comfortable হওয়া।
- L16 — Probability basics: Output probabilities বুঝতে, classification metric (precision/recall) বুঝতে।
- L17 — Distributions (Gaussian): Normal distribution, mean, std — data analysis-এর core.
Tier 2 — ML Engineer / Data Scientist হলে দরকার:
- L12 — Matrix: Pandas/NumPy daily. DataFrame operations matrix operations.
- L18 — Expectation/Variance: A/B testing, model comparison, metric interpretation.
- L19 — Bayes: Naive Bayes, decision-making under uncertainty.
Tier 3 — DL/Research/Custom training হলে দরকার:
- L13 — Derivative: Loss function design.
- L14 — Gradient: Custom loss, debugging gradients.
- L15 — Gradient Descent: Optimizer choice, learning rate tuning.
Role-specific recommendations:
- AI Application Developer (LLM API user): L11, L16, L17 যথেষ্ট। বাকি optional.
- Prompt Engineer: L17 (sampling), L19 (probability) — basic level.
- Data Scientist: All Tier 1 + Tier 2. Tier 3 helpful.
- ML Engineer: All. DL details handle.
- Research Scientist: Module 2 + আরও — multivariate calc, optimization theory, measure theory, RL math.
"Math fobia" overcome strategies:
- Code first: Math notation না বোঝা পর্যন্ত — code চালান। Numerical intuition develop.
- Visual learning: 3Blue1Brown YouTube — gradient, calculus, linear algebra. বাংলায় ABCL TECH-এর ভিডিও।
- Just-in-time learning: "এই concept এখন দরকার" — তখন শিখুন। সব আগে না।
- Build projects: Theoretical formula vs working code — দ্বিতীয়টি দ্রুত intuition দেয়।
- API-first then math: sklearn/PyTorch API দিয়ে result পান — তারপর "কীভাবে কাজ করে" বুঝুন।
"কম math দিয়েও AI সম্ভব?"
- হ্যাঁ — অনেক practical AI.
- OpenAI API + prompt engineering = বহু application.
- HuggingFace + sklearn = traditional ML.
- কিন্তু — debugging, optimization, novel problems — math দরকার।
মূল উপলব্ধি: Module 2 সম্পূর্ণ মুখস্থ লাগে না। Goal-অনুযায়ী prioritize করুন। Math = tool, না identity.
আত্ম-পর্যালোচনা
-
লিখুন: মডিউল ২ থেকে আপনার সবচেয়ে অবাক করা গণিত উপলব্ধি কোনটি? কেন?
সাধারণ "ah-ha" মুহূর্ত:
- "AI = matrix multiply" — magic না, simple algebra.
- "৯৯% accurate test = ১৬.৭% confidence" — Bayes-এর paradox.
- "Gradient = steepest direction" — geometric intuition.
- "CLT — সব Gaussian হয়" — গণিতের জাদু।
- "Naive Bayes কাজ করে যদিও assumption ভুল" — pragmatism > purity.
-
সংযোগ করুন: AI কীভাবে শেখে — সেটা ৩-৪ বাক্যে নিজে ব্যাখ্যা করুন। Vector, Gradient ও Loss — তিনটি শব্দ ব্যবহার করুন।
উদাহরণ ভাল উত্তর:
"AI ডেটাকে vector-এ রূপান্তর করে। Model parameters একটি বিশাল vector. সঠিক উত্তর থেকে কতদূর — সেটা loss নামে একটি একক সংখ্যা। Loss-এর gradient (parameter-এর সাপেক্ষে) বলে কোন দিকে যেতে হবে। Loss কমাতে — বিপরীতে ছোট ধাপ। কোটি কোটি ধাপ পরে — model ভাল predict করে। এটাই AI-এর শেখা।"
-
লক্ষ্য: পরের সপ্তাহে প্রতিদিন একটি Python কোড সেল চালান। প্যারামিটার বদলান। কী পরিবর্তন হয় দেখুন।
সাজেশন routine:
- দিন ১: পাঠ ১৫-এর GD code. Learning rate ০.০০১ থেকে ২.০ পর্যন্ত try করুন।
- দিন ২: পাঠ ১৭-এর Gaussian sampling. μ ও σ পরিবর্তন।
- দিন ৩: পাঠ ১৯-এর Bayes — disease prevalence ১০%, ১%, ০.১%-এ change.
- দিন ৪: প্র ০২-এর linear regression — features বাড়ান।
- দিন ৫-৭: একটি real dataset Kaggle থেকে — practice.
মূল কথা: Code চালান, intuition build করুন। Math papers পরে।
মডিউল ৩-এ আমরা গণিত থেকে AI-চিন্তায় ফিরে যাব। তথ্য তত্ত্ব, সংখ্যাগত স্থিরতা, পরিসংখ্যানের প্রয়োগ — বাস্তব সমস্যা কীভাবে AI-এর ভাষায় রূপান্তর হয়। ১০টি পাঠে — মডিউল ৩।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- পাঠ ২১ · তথ্য তত্ত্ব পরবর্তী পাঠ · মডিউল ৩ শুরু Entropy, KL divergence, cross-entropy — AI loss-এর গভীর গণিত।
- পাঠ ১৯ · Bayes আগের পাঠ কুইজে দুর্বল লাগলে — এই পাঠ আবার পড়ুন।
- পাঠ ১১ · ভেক্টর শুরু থেকে যেকোনো ভিত্তি দুর্বল মনে হলে — মডিউল ২-এর শুরুতে ফিরে যান।
- সব AI Courses দেখুন ABCL TECH Python, ML, DL, NLP, CV, GenAI, RL, MLOps — সব AI কোর্স একসাথে।