ম্যাট্রিক্স — সংখ্যার টেবিল
এই পাঠে যা শিখবেন
- ম্যাট্রিক্স কী — সংখ্যার ২-মাত্রিক টেবিল
- ম্যাট্রিক্স যোগ ও স্কেলার গুণ
- ম্যাট্রিক্স গুণ — কেন এটি AI-এর সবচেয়ে গুরুত্বপূর্ণ অপারেশন
- NumPy দিয়ে ম্যাট্রিক্সের সব কাজ
১ · ম্যাট্রিক্স — ভেক্টরের আত্মীয়
ভেক্টর হলো সংখ্যার ১-মাত্রিক তালিকা। ম্যাট্রিক্সMatrixসংখ্যার একটি ২-D টেবিল — সারি ও কলামসহ। AI-র সব weight, ডেটা ও transformation ম্যাট্রিক্সে রাখা হয়। তার বড় ভাই — সংখ্যার ২-মাত্রিক টেবিল, যেখানে সারি (row) ও কলাম (column) থাকে।
একটি $2 \times 3$ ম্যাট্রিক্স — ২টি সারি, ৩টি কলাম:
$$A = \begin{pmatrix} 1 & 2 & 3 \\ 4 & 5 & 6 \end{pmatrix}$$
$m \times n$ ম্যাট্রিক্স মানে — $m$টি সারি, $n$টি কলাম। উপরের ম্যাট্রিক্সটি $2 \times 3$।
২ · ম্যাট্রিক্স কোথায় ব্যবহার হয়?
একটি Excel টেবিল আসলে একটি ম্যাট্রিক্স। ধরুন একটি দোকানের ৩জন গ্রাহকের ৪টি বৈশিষ্ট্য —
$$\text{গ্রাহক} = \begin{pmatrix} 27 & 35000 & 12 & 4.3 \\ 32 & 50000 & 8 & 4.7 \\ 19 & 15000 & 25 & 3.9 \end{pmatrix}$$
প্রতিটি সারি = একজন গ্রাহক (ভেক্টর)। প্রতিটি কলাম = একটি বৈশিষ্ট্য। এটিই AI-এর "ডেটা" দেখায় কেমন।
৩ · ম্যাট্রিক্স যোগ ও স্কেলার গুণ
ভেক্টরের মতোই — উপাদান-উপাদান:
$$\begin{pmatrix} 1 & 2 \\ 3 & 4 \end{pmatrix} + \begin{pmatrix} 5 & 6 \\ 7 & 8 \end{pmatrix} = \begin{pmatrix} 6 & 8 \\ 10 & 12 \end{pmatrix}$$
স্কেলার গুণ:
$$2 \cdot \begin{pmatrix} 1 & 2 \\ 3 & 4 \end{pmatrix} = \begin{pmatrix} 2 & 4 \\ 6 & 8 \end{pmatrix}$$
৪ · ম্যাট্রিক্স গুণ — সবচেয়ে গুরুত্বপূর্ণ অপারেশন
নিয়ম: $m \times n$ ম্যাট্রিক্সকে $n \times p$ ম্যাট্রিক্স দিয়ে গুণ করলে — ফল হয় $m \times p$ ম্যাট্রিক্স।
মাঝের সংখ্যা ($n$) মিলতে হবে। প্রথমের কলাম-সংখ্যা = দ্বিতীয়ের সারি-সংখ্যা।
উদাহরণ — একটি ছোট গুণ
$A$ হলো $2 \times 2$, $B$ হলো $2 \times 2$:
$$A = \begin{pmatrix} 1 & 2 \\ 3 & 4 \end{pmatrix}, \quad B = \begin{pmatrix} 5 & 6 \\ 7 & 8 \end{pmatrix}$$
$AB$-এর প্রতিটি ঘর = $A$-এর সারি ও $B$-এর কলামের dot productDot Product (অন্তর্-গুণ)দু'টি সমান-দৈর্ঘ্য ভেক্টরের মধ্যে অপারেশন: $\mathbf{a} \cdot \mathbf{b} = \sum a_i b_i$। জ্যামিতিকভাবে = $\|a\|\|b\|\cos\theta$ — এটি দু'টি ভেক্টরের মধ্যে কোণ ও সাদৃশ্য পরিমাপ। AI-তে similarity (cosine similarity), projection, attention — সব এর ভিত্তি।:
- $AB_{11} = 1 \cdot 5 + 2 \cdot 7 = 19$
- $AB_{12} = 1 \cdot 6 + 2 \cdot 8 = 22$
- $AB_{21} = 3 \cdot 5 + 4 \cdot 7 = 43$
- $AB_{22} = 3 \cdot 6 + 4 \cdot 8 = 50$
$$AB = \begin{pmatrix} 19 & 22 \\ 43 & 50 \end{pmatrix}$$
৫ · NumPy দিয়ে ম্যাট্রিক্স — হাতে-কলমে
import numpy as np
# 2x3 ম্যাট্রিক্স
A = np.array([[1, 2, 3],
[4, 5, 6]])
print("A =")
print(A)
print("আকার (shape):", A.shape)
print("মোট ঘর:", A.size)
shape বলবে $(2, 3)$ — মানে ২ সারি, ৩ কলাম। AI কোডে .shape চেক করা প্রতিদিনের কাজ।
ম্যাট্রিক্স গুণ NumPy-তে
import numpy as np
A = np.array([[1, 2], [3, 4]])
B = np.array([[5, 6], [7, 8]])
# ম্যাট্রিক্স গুণ — @ operator (Python 3.5+)
AB = A @ B
print("A @ B =")
print(AB)
# উপাদান-উপাদান গুণ — সম্পূর্ণ ভিন্ন!
print("\nA * B (element-wise):")
print(A * B)
A @ B = প্রকৃত ম্যাট্রিক্স গুণ (output: $19, 22, 43, 50$)। A * B = উপাদান-উপাদান (output: $5, 12, 21, 32$)। দু'টি সম্পূর্ণ ভিন্ন!
৬ · Transpose — সারি-কলাম বদল
একটি ম্যাট্রিক্সের transposeTransposeএকটি ম্যাট্রিক্সের সারি ও কলাম অদলবদল করে নতুন ম্যাট্রিক্স। $m \times n$ → $n \times m$. NumPy-তে A.T। AI-তে অহরহ ব্যবহার হয় — বিশেষ করে gradient ও attention হিসাবে। মানে — সারি ও কলাম অদলবদল। লেখা হয় $A^T$।
$$A = \begin{pmatrix} 1 & 2 & 3 \\ 4 & 5 & 6 \end{pmatrix} \quad \Rightarrow \quad A^T = \begin{pmatrix} 1 & 4 \\ 2 & 5 \\ 3 & 6 \end{pmatrix}$$
import numpy as np
A = np.array([[1, 2, 3],
[4, 5, 6]])
print("A.shape =", A.shape)
print("A.T.shape =", A.T.shape)
print("\nA.T =")
print(A.T)
৭ · কেন AI-এ ম্যাট্রিক্স গুণ এত গুরুত্বপূর্ণ?
একটি Neural Network-এর প্রতিটি স্তর আসলে — একটি ম্যাট্রিক্স গুণ + একটি ছোট রূপান্তরActivation FunctionNeural network-এ non-linear function (ReLU, sigmoid, tanh) — যা layer-এর output-এ প্রয়োগ হয়। এটি ছাড়া পুরো network শুধুই linear হয়ে যেত।।
$$\text{output} = \sigma(W \mathbf{x} + \mathbf{b})$$
- $\mathbf{x}$ = ইনপুট ভেক্টর (ছবি, লেখা, কণ্ঠ)
- $W$ = "ওজন" ম্যাট্রিক্স — যা মডেল ডেটা থেকে শেখে
- $\mathbf{b}$ = "biasBiasNeural network-এর শেখা constant offset — output-এ যোগ হয়। weight-এর পাশাপাশি bias-ও training-এ শিখে নেওয়া হয়।" ভেক্টর — সামান্য সমন্বয়
- $\sigma$ = activation function (যেমন ReLUReLU · Rectified Linear Unitসবচেয়ে জনপ্রিয় activation function: $f(x) = \max(0, x)$। ঋণাত্মক হলে ০, ধনাত্মক হলে নিজে। সরল কিন্তু গভীর network-এ বিস্ময়করভাবে কার্যকর।)
ChatGPT-এর মতো একটি বড় মডেলে — প্রতিটি প্রশ্নে কোটি কোটি ম্যাট্রিক্স গুণ হয়। GPU-গুলো এই কাজে এত দ্রুত কারণ — ম্যাট্রিক্স গুণ সমান্তরালভাবে অসংখ্য ছোট গণনা একসাথে করতে পারে।
৮ · বিশেষ ম্যাট্রিক্স
- Identity matrixIdentity Matrix (I)একটি square matrix — কর্ণে ১, বাকি ০। বৈশিষ্ট্য: $A \cdot I = I \cdot A = A$ — সংখ্যার ১-এর মতো ম্যাট্রিক্সের neutral element. linear transformation-এ "কোনো পরিবর্তন না" বোঝায়। NumPy:
np.eye(n)। ($I$): কর্ণের সব ঘরে ১, বাকি সব ০। যেকোনো ম্যাট্রিক্সকে $I$ দিয়ে গুণ করলে সে অপরিবর্তিত থাকে। - Zero matrix ($\mathbf{0}$): সব ঘরে ০।
- Square matrix: সারি ও কলাম সমান সংখ্যক।
- Symmetric matrix: $A = A^T$।
import numpy as np
# 3x3 identity matrix
I = np.eye(3)
print("Identity matrix:")
print(I)
# Zero matrix
Z = np.zeros((2, 4))
print("\n2x4 zero matrix:")
print(Z)
# Random matrix
R = np.random.rand(2, 3)
print("\n2x3 random matrix:")
print(R)
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ সাধারণত $AB \neq BA$। কেন? কখন এটা সমান হয়? এই non-commutativity AI-তে কী প্রভাব ফেলে?
ম্যাট্রিক্স গুণ commutative নয় — এটাই linear algebra-র সবচেয়ে সূক্ষ্ম পার্থক্য সংখ্যা থেকে।
উদাহরণ — সরাসরি দেখা:
- $A = \begin{pmatrix}1&1\\0&1\end{pmatrix}$, $B = \begin{pmatrix}1&0\\1&1\end{pmatrix}$।
- $AB = \begin{pmatrix}2&1\\1&1\end{pmatrix}$।
- $BA = \begin{pmatrix}1&1\\1&2\end{pmatrix}$।
- সম্পূর্ণ ভিন্ন।
জ্যামিতিক কারণ: ম্যাট্রিক্স = transformation. "প্রথমে rotate, পরে stretch" ≠ "প্রথমে stretch, পরে rotate"। ক্রম গুরুত্বপূর্ণ।
কখন $AB = BA$?
- একটি $I$ হলে।
- একটি scalar multiple of $I$ হলে।
- $A = B$ হলে।
- $A^{-1} = B$ হলে (inverse)।
- উভয়ই diagonal হলে।
- উভয়ই simultaneously diagonalizable হলে।
AI-তে প্রভাব:
- Layer order matters: Conv → BatchNorm → ReLU. ক্রম বদলালে নেটওয়ার্ক ভিন্নভাবে কাজ করে।
- Attention mechanism: $QK^T$ ও $K^TQ$ ভিন্ন। Transformer-এ specific order.
- Backprop: chain rule-এ matrix derivatives ক্রমে গুণ — order-sensitive.
- Optimization: "Whitening" করতে gradient updates orthogonal করে নন-commutativity অংশত সমাধান।
মূল উপলব্ধি: AI-তে "ক্রম গুরুত্বপূর্ণ" — সংখ্যার তুলনায় পদ্ধতিগতভাবেই। এই কারণে layer architecture একটি ডিজাইন সিদ্ধান্ত।
প্র ০২ একটি 224×224 RGB ছবি একটি Neural Network-এ পাঠানো হলে — কী shape-এর কী ম্যাট্রিক্স গুণ ঘটে? Transformer-এ এটি কেমন ভিন্ন?
এই প্রশ্ন AI-র ভেতর "কী ঘটে" এর হাড়ের গভীরে নিয়ে যায়।
CNN-এ একটি ছবি (যেমন ResNet-50):
- Input: $224 \times 224 \times 3$ (height × width × channel)।
- প্রথম conv layer — $3 \times 3$ kernel, ৬৪ filter. Output: $224 \times 224 \times 64$।
- প্রতিটি conv ভেতরে — im2col rearrange, তারপর বিশাল ম্যাট্রিক্স গুণ।
- একটি image-এ ResNet-50 চালালে — মোট ~৪ বিলিয়ন multiply-add operations.
- শেষে — $1 \times 1000$ output (1000 classes-এর scores)।
Transformer-এ একটি sentence (যেমন GPT):
- Input: ৫১২ tokens × ৪০৯৬-D embedding = $512 \times 4096$ matrix.
- প্রতিটি attention layer-এ:
- $Q = X W_Q$ — $(512 \times 4096) \cdot (4096 \times 4096)$।
- $K = X W_K$, $V = X W_V$ — একই shape.
- $\text{Attention} = \text{softmax}(QK^T / \sqrt{d_k}) V$ — $(512 \times 512)$ attention matrix.
- প্রতি token = ৪০৯৬ floats; ৫১২ tokens × ৯৬ layers × ৯৬ heads = বিশাল compute.
- GPT-৪ scale: প্রতি query ~১০ trillion FLOPs.
মূল পার্থক্য CNN বনাম Transformer:
- CNN: Spatial structure (নিকটতম pixels-এর সম্পর্ক)। Translation invariance. শ্রেণিবদ্ধ feature hierarchy.
- Transformer: Pairwise interaction সব tokens-এর মধ্যে। Self-attention = "এই token অন্য সবগুলোর সাথে কত related"।
- Compute pattern: CNN — local + dense. Transformer — global + sparse-ish.
GPU দ্রুত কেন:
- NVIDIA H100 — secondly ~১,০০০ TFLOPs ম্যাট্রিক্স গুণে।
- প্রতিটি SM (streaming multiprocessor) সমান্তরালভাবে হাজার হাজার multiply-add.
- "Tensor cores" — specifically matrix-multiply-accelerate.
- Memory bandwidth-ও critical — H100-এ HBM3, ~৩ TB/s.
উপলব্ধি: AI = matrix multiply + non-linearity, repeated. সবকিছুই এই দু'টির variation. বুঝলে — AI architecture পড়া সহজ হয়ে যায়।
প্র ০৩ একটি ম্যাট্রিক্স একটি "transformation"। 2D-তে rotation, scaling, shearing — কোন ম্যাট্রিক্স কী করে? কীভাবে চিনবেন?
এই প্রশ্ন linear algebra-র "geometric soul" — শুধু সংখ্যা নয়, geometric অর্থ।
প্রতিটি ম্যাট্রিক্স = একটি linear transformationLinear Transformationএকটি function যা ভেক্টর space-কে অন্য ভেক্টর space-এ map করে — যোগ ও স্কেলার গুণ সংরক্ষণ করে। প্রতিটি linear transformation = একটি ম্যাট্রিক্স গুণ।:
$A = \begin{pmatrix}a&b\\c&d\end{pmatrix}$ — দু'টি column বলে: standard basis vectors $\hat{i}=(1,0)$ ও $\hat{j}=(0,1)$ কোথায় যায়।
Common transformations:
- Identity ($I$): $\begin{pmatrix}1&0\\0&1\end{pmatrix}$ — কিছু পরিবর্তন না।
- Scaling (uniform): $\begin{pmatrix}2&0\\0&2\end{pmatrix}$ — সব দিকে ২× বড়।
- Scaling (non-uniform): $\begin{pmatrix}3&0\\0&1\end{pmatrix}$ — শুধু x-axis-এ ৩× stretch.
- Rotation by $\theta$: $\begin{pmatrix}\cos\theta&-\sin\theta\\\sin\theta&\cos\theta\end{pmatrix}$। উদাহরণ — ৯০° rotation: $\begin{pmatrix}0&-1\\1&0\end{pmatrix}$।
- Reflection (x-axis): $\begin{pmatrix}1&0\\0&-1\end{pmatrix}$ — y উল্টে যায়।
- Shearing: $\begin{pmatrix}1&1\\0&1\end{pmatrix}$ — উপরের অংশ ডানে hauls.
- Projection (onto x-axis): $\begin{pmatrix}1&0\\0&0\end{pmatrix}$ — y vanishes; rank reduce.
চিহ্নিত করার সূত্র:
- DeterminantDeterminantএকটি square matrix থেকে বের হওয়া একক সংখ্যা — যা transformation-এর "area/volume scaling factor" বোঝায়। $\det = 0$ হলে ম্যাট্রিক্স singular (invertible না)।: $\det(A) = ad-bc$।
- $|\det| = $ "area scaling factor"।
- $\det = 0$ → degenerate (projection)।
- $\det < 0$ → reflection.
- EigenvaluesEigenvalueএকটি linear transformation-এর "বিশেষ" দিক (eigenvector) বরাবর scaling factor. PCA, spectral clustering, stability analysis — সব এর উপর। সমীকরণ: $A\mathbf{v} = \lambda\mathbf{v}$।: "অপরিবর্তিত" দিকের scaling.
- Pure rotation — eigenvalues complex.
- Pure scaling — both eigenvalues real, positive.
- Trace: diagonal elements-এর যোগ। Rotation matrix-এ $= 2\cos\theta$।
AI-তে geometric অর্থ:
- Weight matrix — input space-কে rotate, scale, project করে।
- Backprop "ভাল direction"-এ পৌঁছায় — geometric reasoning.
- Embedding space-এর "rotation" সংরক্ষণে — semantic relationships বজায় থাকে।
- SVD (Singular Value Decomposition) — যেকোনো linear transformation = rotation + scaling + rotation.
মূল উপলব্ধি: ম্যাট্রিক্স শুধু "সংখ্যা" না — space-এ একটি action. এই geometric দৃষ্টি Linear Algebra-র সব কিছু সহজ করে।
প্র ০৪ "AI-এর ভেতরে কোনো জাদু নেই" — Deep Learning শুধুই matrix multiply + non-linearity. তাহলে কেন এত সরল গণিত এত শক্তিশালী?
এটি AI-র সবচেয়ে দার্শনিক প্রশ্ন। সরল উপাদান, কিন্তু সম্মিলিত শক্তি বিস্ময়কর।
"কী দিয়ে গঠিত" সরল:
- Linear: $y = Wx + b$ (matrix multiply + bias)।
- Non-linear: ReLU = $\max(0, x)$। সরলতম।
- Loss + gradient descent.
- এই তিনটি কম্পোনেন্ট পুনরাবৃত্তি।
কেন তবু শক্তিশালী — Universal Approximation Theorem:
- ১৯৮৯-এ Cybenko ও Hornik প্রমাণ করেন — যথেষ্ট wide neural network যেকোনো continuous function approximate করতে পারে।
- একটি hidden layer যথেষ্ট — তবে অসংখ্য neuron লাগে।
- Depth — efficient parametrization দেয় (Bengio-Lecun গবেষণা)।
Composition-এর শক্তি:
- একটি layer = সরল transformation.
- ১০০ layers compose = প্রায় unlimited expressiveness.
- "Compositionality" — মৌলিক mathematical principle.
- উদাহরণ: প্রতিটি digital electronics — শুধু AND/OR/NOT gates. কিন্তু পুরো computer.
Implicit bias of gradient descent:
- SGD train-এ স্বাভাবিকভাবেই simpler solutions বাছে।
- Lottery Ticket Hypothesis — random initialization-এ "winning" subnetworks পেতে যায়।
- Implicit regularization — overfitting কম, generalization ভাল।
Scale magic:
- Scaling laws (Kaplan ২০২০, Hoffmann ২০২২): বেশি data + বেশি compute + বেশি params = predictably better.
- Emergent capabilities — কিছু capability সরলভাবে appear করে scale-এ (CoT reasoning, in-context learning)।
- "Bitter Lesson" (Sutton ২০১৯) — clever algorithm-এর চেয়ে scalable methods জিতে।
Geometric perspective:
- Each layer — একটি manifold-এ নন-linear warping.
- Deep network — high-D ডেটাকে ধীরে ধীরে disentangle.
- Final layer — linearly separable representation.
মূল উপলব্ধি: "Magic-এর অভাব" আসলে শক্তি। সরল উপাদান + scale + compose + gradient — এই রেসিপি প্রকৃতির অনেক জটিল ঘটনার সাথে সম্পর্কিত (evolution, neuroscience)। এটি accident না — এটি deeply mathematical.
গুরুত্বপূর্ণ caveat: Magic-এর অভাব মানে "we understand" না। আজও DL-এর কেন কাজ করে — তা open research. Linear algebra ভিত্তি, কিন্তু interpretability এখনো আংশিক।
অনুশীলন
-
হাতে গণনা: $A = \begin{pmatrix} 2 & 1 \\ 0 & 3 \end{pmatrix}$, $B = \begin{pmatrix} 1 & 4 \\ 2 & 5 \end{pmatrix}$। $AB$ ও $BA$ বের করুন। কী লক্ষ্য করলেন?
$AB = \begin{pmatrix} 2 \cdot 1 + 1 \cdot 2 & 2 \cdot 4 + 1 \cdot 5 \\ 0 \cdot 1 + 3 \cdot 2 & 0 \cdot 4 + 3 \cdot 5 \end{pmatrix} = \begin{pmatrix} 4 & 13 \\ 6 & 15 \end{pmatrix}$।
$BA = \begin{pmatrix} 1 \cdot 2 + 4 \cdot 0 & 1 \cdot 1 + 4 \cdot 3 \\ 2 \cdot 2 + 5 \cdot 0 & 2 \cdot 1 + 5 \cdot 3 \end{pmatrix} = \begin{pmatrix} 2 & 13 \\ 4 & 17 \end{pmatrix}$।
লক্ষ্য করার বিষয়: $AB \neq BA$ — ম্যাট্রিক্স গুণ commutative নয়।
-
NumPy-তে যাচাই: উপরের গণনা NumPy দিয়ে যাচাই করুন।
import numpy as np A = np.array([[2, 1], [0, 3]]) B = np.array([[1, 4], [2, 5]]) print(A @ B) # [[ 4 13] [ 6 15]] print(B @ A) # [[ 2 13] [ 4 17]] -
চিন্তা করুন: বাংলাদেশের ১০০ গ্রাহক, প্রত্যেকের ৫টি বৈশিষ্ট্য। ম্যাট্রিক্সের আকার কত হবে? ১ গ্রাহকের জন্য AI মডেল চালালে — কোন আকারের ম্যাট্রিক্স গুণ লাগবে?
- Data matrix: $100 \times 5$ — ১০০ rows (গ্রাহক), ৫ columns (features)।
- ১ গ্রাহক: $1 \times 5$ vector.
- একটি hidden layer (যেমন ৫ → ১০ neurons): Weight matrix $W$ আকার $5 \times 10$।
- গুণ: $(1 \times 5) \cdot (5 \times 10) = (1 \times 10)$। মাঝের ৫ মিলে যায়।
- সব ১০০ গ্রাহক একসাথে (batch): $(100 \times 5) \cdot (5 \times 10) = (100 \times 10)$। GPU-তে এটাই efficient.
মূল কথা: Batch processing = একই গণনা সমান্তরালে। GPU-র মূল শক্তি।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- পাঠ ১৩ · ডেরিভেটিভ ও ঢাল পরবর্তী পাঠ ম্যাট্রিক্স থেকে gradient — neural network কীভাবে শেখে তার গণিত।
- পাঠ ১১ · ভেক্টর আগের পাঠ ম্যাট্রিক্স আসলে ভেক্টরের stacking — ভিত্তি দুর্বল লাগলে ফিরে যান।
- সব AI Courses দেখুন ABCL TECH Python, ML, DL, NLP, CV, GenAI, RL, MLOps — সব AI কোর্স একসাথে।