ডেটা সায়েন্স কী — কাজের ধরন
এই পাঠে যা শিখবেন
- ডেটা সায়েন্স প্রকৃতপক্ষে কী — তিনটি স্তম্ভ (গণিত, কোডিং, ডোমেইন জ্ঞান)
- Data Analyst, Data Scientist ও ML Engineer — কাজের পার্থক্য কোথায়
- একজন ডেটা সায়েন্টিস্টের সাধারণ একটি দিন কেমন কাটে
- বাংলাদেশের কোন কোম্পানি কী ধরনের ডেটা সমস্যা solve করছে
১ · ডেটা সায়েন্স — সংজ্ঞা ও তিন স্তম্ভ
ডেটা সায়েন্সData Scienceএকটি interdisciplinary ক্ষেত্র — গণিত (পরিসংখ্যান), কম্পিউটার বিজ্ঞান (programming) এবং ডোমেইন জ্ঞান একত্রে ব্যবহার করে raw data থেকে actionable insight বের করার বিজ্ঞান। ২০০৮-এ DJ Patil ও Jeff Hammerbacher প্রথম "Data Scientist" পদ চালু করেন। এমন একটি ক্ষেত্র যেখানে আপনি "ডেটা" নামক কাঁচামালকে "সিদ্ধান্ত" নামক পণ্যে রূপান্তর করেন। গবেষক Drew Conway-এর বিখ্যাত Venn diagram অনুযায়ী এর তিনটি মূল স্তম্ভ আছে:
১) গণিত ও পরিসংখ্যান: probability, statistics, linear algebra — যা দিয়ে ডেটার ভেতরে pattern খোঁজা হয়।
২) প্রোগ্রামিং দক্ষতা: Python/R, SQL, ও বিভিন্ন library দিয়ে ডেটা manipulate করা।
৩) ডোমেইন জ্ঞান: ব্যবসা/বিষয়টি জানা — কোন প্রশ্নের উত্তর আসলেই দরকার।
গণিত ছাড়া কোডিং = "machine learning malpractice"। কোডিং ছাড়া গণিত = কাগজে আটকে থাকা গবেষণা। ডোমেইন জ্ঞান ছাড়া দু'টোই = ভুল প্রশ্নের সঠিক উত্তর। তিনটি একসাথেই ডেটা সায়েন্স।
২ · "কী ঘটেছে" থেকে "কী করব" — চার স্তর বিশ্লেষণ
Gartner-এর বিখ্যাত analytics maturity model অনুযায়ী ডেটা বিশ্লেষণ চারটি স্তরে বিভক্ত — প্রতিটি স্তর আগেরটির চেয়ে বেশি মূল্য সৃষ্টি করে কিন্তু বেশি জটিল।
- Descriptive (বর্ণনামূলক): "গত মাসে bKash-এ কত transaction হয়েছে?" — ডেটার সারসংক্ষেপ।
- Diagnostic (নির্ণয়মূলক): "কেন গত সপ্তাহে cash-out হঠাৎ ১৫% কমে গেল?" — কারণ অনুসন্ধান।
- Predictive (পূর্বাভাসমূলক): "আগামী ঈদে কত নতুন user আসবে?" — ভবিষ্যতের অনুমান।
- Prescriptive (নির্দেশনামূলক): "user retention বাড়াতে কোন offer কোন গ্রাহককে দেব?" — সিদ্ধান্ত automation।
৩ · Data Analyst vs Data Scientist vs ML Engineer
নতুনদের সবচেয়ে বড় বিভ্রান্তি — এই তিনটি role-এর পার্থক্য। কোম্পানিভেদে border একটু এদিক-ওদিক হয়, কিন্তু core পার্থক্য নিচের মতো:
- Data Analyst: SQL ও Excel/Tableau-এ পারদর্শী। প্রধান প্রশ্ন — "কী ঘটেছে এবং কেন?"। output: dashboard, report, KPI। বাংলাদেশে এই পদে শুরুতে বেতন ৩০,০০০–৬০,০০০ টাকা।
- Data Scientist: Python/R, statistics, machine learning জানেন। প্রধান প্রশ্ন — "কী হবে এবং কোনটি optimal?"। output: predictive model, A/B test result, feature engineering pipeline।
- ML Engineer: Software engineering + ML। প্রধান প্রশ্ন — "মডেলটি ১ লক্ষ user-এর জন্য রিয়েল-টাইমে কীভাবে চলবে?"। output: production API, monitoring system, scalable inference pipeline।
- Data Engineer: ডেটা pipeline বানান — Kafka, Airflow, warehouse। উপরের সবার "জ্বালানি" সরবরাহ করেন। বাংলাদেশে এদের বেতন প্রায়ই Data Scientist-এর সমান বা বেশি।
৪ · একজন ডেটা সায়েন্টিস্টের সাধারণ দিন
শুরুতে অনেকেই ভাবেন — সারাদিন complex algorithm লিখব, neural network train করব। বাস্তবে চিত্রটি অনেক ভিন্ন। ৮০/২০ নিয়মটি প্রায় সব survey-তে নিশ্চিত হয়েছে:
- ~৪০%: ডেটা সংগ্রহ ও cleaning — SQL query, missing value handling, outlier detection।
- ~২০%: EDA (Exploratory Data Analysis) — গ্রাফ আঁকা, distribution দেখা, hypothesis তৈরি।
- ~১৫%: stakeholder মিটিং, প্রশ্ন বোঝা, প্রেজেন্টেশন বানানো।
- ~১৫%: মডেল তৈরি, train, evaluate।
- ~১০%: deployment, monitoring, documentation।
অর্থাৎ "fancy ML" পুরো কাজের ১৫%। বাকি ৮৫% হলো ডেটা ও মানুষের সাথে কাজ। তাই SQL এবং communication skill — মডিউল ১-এর কেন্দ্রবিন্দু।
৫ · বাংলাদেশে ডেটা সায়েন্স — কে কী করছেন?
"ডেটা সায়েন্স পশ্চিমা ব্যাপার, এখানে চাকরি নেই" — এই ভ্রান্ত ধারণা এখনো অনেকে রাখেন। বাস্তবে গত ৫ বছরে বাংলাদেশের প্রায় সব বড় ডিজিটাল কোম্পানি analytics team তৈরি করেছে।
- bKash: fraud detection, agent network optimization, customer churn prediction। দিনে কোটি transaction-এর pattern বিশ্লেষণ।
- Daraz: recommendation system, demand forecasting, dynamic pricing, search ranking।
- Pathao: ride ETA prediction, surge pricing, rider-customer matching, ফুড ডেলিভারি ETA।
- Grameenphone, Robi: network analytics, customer segmentation, churn prediction।
- Banks (BRAC, City, EBL): credit scoring, fraud detection, customer lifetime value।
- Government & NGOs: BBS-এর census, BRAC-এর field survey, World Bank-এর economic indicator।
৬ · কেন ডেটা সায়েন্স শিখবেন — তিনটি কারণ
- Decision-making power: "মনে হয় এই product সফল হবে" বনাম "ডেটা বলছে এই product-এর target audience-এ ৬৩% adoption probability" — দু'টি বাক্যের শক্তি ভিন্ন।
- Career flexibility: Finance, healthcare, education, e-commerce, government — ডেটা সব জায়গায়। ডেটা দক্ষতা portable।
- AI-এর ভিত্তি: ML/DL শেখার আগে statistics, SQL, pandas — এই foundation না থাকলে neural network শুধু "magic box" থেকে যাবে।
৭ · এই কোর্সে আপনি কী পাবেন
এই ৩০-পাঠের কোর্সটি চারটি মডিউলে সাজানো — প্রতিটি মডিউল বাস্তব workplace skill-এ ফোকাসড।
- মডিউল ১ (পাঠ ১–৭): ডেটা সংগ্রহ ও SQL — যেকোনো ডেটা টিমের ভিত্তি।
- মডিউল ২ (পাঠ ৮–১৫): পরিসংখ্যান ও hypothesis testing — সিদ্ধান্তের রিগর।
- মডিউল ৩ (পাঠ ১৬–২৩): EDA ও feature engineering — ML-এর preparation।
- মডিউল ৪ (পাঠ ২৪–৩০): visualization ও dashboard — insight communicate করা।
৮ · প্রথম SQL ঝলক
পরের পাঠ থেকে আপনি SQL দিয়ে ডেটা টানতে শিখবেন। নিচে একটি sample query — এটিই Data Analyst-এর "hello world"। সিনট্যাক্স এখন বুঝতে হবে না, শুধু feel নিন:
-- Daraz-এর গত ৩০ দিনের top-৫ ক্যাটেগরি
SELECT
category,
COUNT(*) AS order_count,
SUM(total_amount) AS revenue_bdt
FROM orders
WHERE order_date >= CURRENT_DATE - INTERVAL '30 days'
GROUP BY category
ORDER BY revenue_bdt DESC
LIMIT 5;
৯ · কী লাগবে — prerequisites
এই কোর্স শুরু করার আগে আপনার যা থাকা ভাল:
- Python basics: variable, list, function, loop। আমাদের Python for AI কোর্স এই foundation দেয়।
- উচ্চ মাধ্যমিক গণিত: গড়, percentage, basic algebra। অসাধারণ math দরকার নেই — আমরা পথে শিখাব।
- কৌতূহল: "এই সংখ্যাটি কেন এমন?" — এই প্রশ্ন স্বাভাবিকভাবে আসা।
ভাবনার প্রশ্ন
প্রতিটি প্রশ্ন নিজে কিছুক্ষণ ভাবুন — তারপর "→ উত্তর" চাপুন।
প্র ০১ "ডেটা সায়েন্স" শব্দটি ২০০৮-এ জনপ্রিয় হয়। কিন্তু statistics, BI, operations research আগে থেকেই ছিল। আসলে নতুন কী এসেছে — শুধু একটি rebranding, নাকি genuine paradigm shift?
এটি data community-র একটি দীর্ঘস্থায়ী বিতর্ক। উত্তর — আংশিকভাবে দু'টোই সত্য।
যেখানে এটি rebranding:
- regression, hypothesis testing, clustering — সব technique ১৯২০–১৯৭০-এ statistics-এ আবিষ্কৃত।
- "BI analyst" পদ ১৯৯০-এ Walmart, IBM-এ ছিল — কাজ প্রায় একই।
- Operations Research (WWII থেকে) — optimization, decision-making — পুরোটাই overlap।
যেখানে genuine paradigm shift:
- Scale: ১৯৯০-এ "big" data ছিল ১ GB। আজ Daraz daily ~৫০০ GB log generate করে। এই scale-এ traditional statistics tool কাজ করে না।
- Compute: GPU, cloud — model এখন laptop-এ train হয় যা ২০০৫-এ supercomputer লাগত।
- Open source ecosystem: scikit-learn, TensorFlow, PyTorch, pandas — প্রতিটি technique আজ ১০ লাইনে availble।
- Data সর্বত্র: smartphone, IoT, web log — প্রতিটি action ডেটা generate করে।
- Domain integration: পুরোনো statistician academy-তে থাকতেন। ডেটা সায়েন্টিস্ট business team-এর সাথে বসেন।
মূল উপলব্ধি: Theory পুরোনো, but the practice is new। ১৯৮৫-এর tool দিয়ে আজকের কাজ করা impossible।
প্র ০২ একটি বাংলাদেশী bank আপনাকে hire করতে চায় — কিন্তু ঠিক করতে পারছে না Data Analyst, Data Scientist নাকি ML Engineer। কোন প্রশ্নগুলো জিজ্ঞেস করে আপনি ঠিক করবেন কোন role আসলে দরকার?
এটি বাস্তব consulting scenario। ভুল role hire করা কোম্পানির বড় খরচ।
যে প্রশ্নগুলো জিজ্ঞেস করবেন:
- "আপনাদের ডেটা কোথায়?":
- "Excel-এ" → Data Analyst যথেষ্ট।
- "PostgreSQL/MySQL warehouse-এ" → Analyst বা Scientist।
- "Hadoop/Spark cluster-এ, real-time stream-এ" → ML Engineer + Data Engineer।
- "কী সিদ্ধান্ত নিতে চান?":
- "মাসিক report, KPI dashboard" → Analyst।
- "কোন গ্রাহক loan default করবে predict" → Scientist।
- "প্রতি transaction-এ real-time fraud check" → ML Engineer।
- "আগে কেউ এই role-এ ছিলেন?":
- "না, আপনিই প্রথম" → full-stack person দরকার।
- "৫ জনের team আছে" → specialist hire করা যায়।
- "Production system-এ কত user?": ২০ লাখ গ্রাহক, ২৪/৭ uptime → MLE অপরিহার্য।
- "Compliance/regulation requirement?": Bangladesh Bank-এর জন্য interpretability + audit trail অপরিহার্য — logistic regression preferred।
সাধারণ pattern:
- Stage 1: ডেটা বিচ্ছিন্ন → প্রথম hire = Data Analyst।
- Stage 2: Dashboard আছে, "কেন" বুঝতে চান → Data Scientist।
- Stage 3: Model আছে কিন্তু production-এ লাগানো যাচ্ছে না → ML Engineer।
- Stage 4: অনেক model production-এ — Data Engineer + MLOps টিম।
মূল উপলব্ধি: "কোন role দরকার" — কোম্পানির ডেটা maturity stage-এ নির্ভর করে।
প্র ০৩ ডেটা সায়েন্টিস্টের কাজের ৮০% হলো ডেটা cleaning। তবু university course-এ এই অংশ মাত্র ১০-১৫% time পায়। কেন এই mismatch — এবং কীভাবে নিজেকে এই critical work-এ দক্ষ করবেন?
এটি ডেটা শিক্ষার একটি পরিচিত paradox।
Mismatch-এর কারণ:
- Academic incentive: Professor publish করেন novel algorithm-এ। "নতুন cleaning trick" publishable নয়।
- Sanitized datasets: Iris, MNIST, Titanic — সব "ক্লিন"। Real-world ডেটায় ৪০% missing থাকে।
- Glamour gap: "Neural network train" কঠিন বলে মনে হয়; "encoding fix" কে important মনে হয় না।
- Time constraint: Semester-এ deep dive করার সময় কম।
"Boring" work-এ দক্ষ হওয়ার কৌশল:
- Kaggle "raw" datasets: জনপ্রিয় cleaned dataset এড়িয়ে raw dataset নিন। Bangladesh-এর open data portal থেকে government CSV।
- Cleaning চেকলিস্ট: duplicate? null? type mismatch? outlier? encoding? timezone? leakage? — ১০-পয়েন্ট চেকলিস্ট।
- SQL gymnastics: JOIN edge cases, window function, recursive CTE — যত complex query practice করবেন, real data wrangling তত সহজ লাগবে।
- "Domain interview": প্রতিটি ডেটাসেটে domain expert-এর সাথে ১৫ মিনিট কথা — "এই column কী?"
- "Data diff": দু'টি ডেটা snapshot-এর মধ্যে কী বদলেছে — schema, distribution — এটি bug ধরে।
- Documentation discipline: প্রতিটি cleaning decision-এ comment। ৬ মাস পর নিজেও বুঝবেন।
Mindset shift:
- "Data cleaning হলো ডেটাকে সম্মান করা।" Garbage in → garbage out।
- সবচেয়ে দামি model-ও noisy ডেটার সাথে নষ্ট হয়; simple model + clean data প্রায়ই বেশি ভাল।
- Senior data scientist-রা cleaning-এ ৫ গুণ দ্রুত — কারণ pattern চিনে ফেলেন।
মূল উপলব্ধি: "Boring" বলতে যা মনে হয়, সেটাই আসল কাজ। যিনি Excel encoding bug ধরতে পারেন — তিনিই production-এ trust পান।
প্র ০৪ আপনি Pathao-এর জন্য নতুন data team-এ join করেছেন। প্রথম সপ্তাহে কী করবেন — "100% productive থাকতে চাই" বনাম "context বুঝতে চাই" — কীভাবে balance করবেন?
নতুন ডেটা টিমে প্রথম সপ্তাহ critical। ভুল করলে — পরের ৬ মাস ভুল প্রশ্নের ভাল উত্তর তৈরি করতে থাকবেন।
সপ্তাহ ১: শুধু observe ও বুঝুন
- Day 1–2: Setup — laptop, VPN, database access, Slack/Teams, repo।
- Day 3: business overview — Pathao কী করে, revenue কীভাবে আসে।
- Day 4: ডেটা landscape — কোন warehouse, কোন table, কে owner।
- Day 5: existing dashboard ও report। কে কোনটা use করে।
সপ্তাহ ২: ছোট shadowing
- Senior একজনের একটি existing query দেখে নিজে rewrite করুন।
- একটি existing report from-scratch reproduce। কোথায় hidden assumption?
- একটি নতুন প্রশ্ন stakeholder-এর সাথে clarify।
"100% productive" trap এড়াতে:
- প্রথম সপ্তাহে "code-line" lash করার দরকার নেই।
- প্রতিদিন একটি jargon list — কোম্পানি-specific terms লিখে রাখুন।
- "কেন এই metric?" প্রশ্ন করতে লজ্জা পাবেন না।
- একটি "questions doc" রাখুন — দিনের শেষে review।
"Context" trap এড়াতে:
- ক্রমাগত শুধু পড়লে কোম্পানির মানুষ "passive" মনে করতে পারে।
- সপ্তাহ ১-এর শেষে একটি ছোট তবু visible delivery।
- Slack-এ daily learning summary share করতে পারেন।
সম্পর্ক প্রথম, code পরে:
- Data team alone কাজ করে না — product, ops, finance-এর সাথে সম্পর্ক critical।
- প্রথম মাসে ১০ জনের সাথে coffee chat — পরের ৬ মাসে কাজ ৫× সহজ।
- "আপনার সবচেয়ে frustrating data problem কী?" — এই প্রশ্ন থেকেই next big project আসবে।
মূল উপলব্ধি: Onboarding একটি investment। "Slow is smooth, smooth is fast।"
অনুশীলন
-
Role identification: নিচের তিনটি প্রশ্নের প্রতিটি — Data Analyst, Data Scientist নাকি ML Engineer-এর কাজ?
- (ক) "Daraz-এর গত তিন মাসের top-১০ পণ্যের weekly trend দেখাও।"
- (খ) "প্রতিটি Pathao ride-এ real-time ETA estimate করো।"
- (গ) "কোন গ্রাহকরা পরের ৩০ দিনে churn করবেন তা predict করো।"
- (ক) Data Analyst — historic data summarize, dashboard/report।
- (খ) ML Engineer — real-time, low-latency inference, scaling।
- (গ) Data Scientist — predictive model, feature engineering, evaluation।
-
Maturity assessment: একটি বাংলাদেশী SME ১০টি Excel sheet-এ ব্যবসার সব ডেটা রাখে। তারা "AI দিয়ে ভবিষ্যৎ predict করতে চায়।" আপনি কী suggest করবেন?
- প্রথমে ভিত্তি: Excel → একটি simple database। data quality audit।
- Descriptive আগে: বেসিক KPI dashboard — "গত মাসে কী ঘটেছে?"
- Predictive পরে: ৩-৬ মাস clean ডেটা জমলে তারপর forecast।
- Honest expectation: "AI" word-এ লোভ না দেখিয়ে business value-এ ফোকাস।
-
আত্মবিশ্লেষণ: তিন স্তম্ভের (গণিত, কোডিং, ডোমেইন) মধ্যে আপনার সবচেয়ে দুর্বল কোনটি? পরের ৪ সপ্তাহে সেটি কীভাবে শক্তিশালী করবেন?
- গণিত দুর্বল? Khan Academy statistics → এই কোর্সের পাঠ ৮–১৫।
- কোডিং দুর্বল? দিনে ১ ঘণ্টা SQL practice + ১টি pandas tutorial weekly।
- ডোমেইন দুর্বল? একটি industry বেছে নিন — তার podcast follow।
মূল কথা: তিনটিতে "perfect" হতে হবে না — তবু weakest link 6/10-এর নিচে গেলে full-stack DS difficult।
আরও পড়ুন · ABCL TECH-এ আপনার পরবর্তী পদক্ষেপ
- পাঠ ০২ · CRISP-DM ও কাজের পদ্ধতি পরবর্তী পাঠ কীভাবে বাস্তব ডেটা-প্রজেক্ট পরিচালনা করবেন।
- কোর্স তালিকা আগের পাতা ৩০টি পাঠের পুরো outline দেখুন।
- পাঠ ০৩ · SQL পরিচিতি এই পাঠের সাথে সম্পর্কিত যেকোনো ডেটা চাকরিতে SQL-ই প্রথম দিনের tool।
- সব AI Courses দেখুন ABCL TECH Python, ML, DL, NLP, CV, GenAI, RL, MLOps — সব AI কোর্স একসাথে।