খালি ইনপুটের পাঠ: ক্রিকেট বিশ্লেষণে ফরম্যাট-প্রসঙ্গ, স্যাম্পল-শৃঙ্খল ও ভেরিফিকেশনের চেইন
**মূল উত্তর (≤৬০ শব্দ):** ক্রিকেট বিশ্লেষণে যেকোনো সিদ্ধান্তের আগে পাঁচ স্তরের ভেরিফিকেশন দরকার — ফরম্যাট, স্যাম্পল, ভূমিকা, পরিবেশ ও ম্যাচ-অবস্থা। কোনো একটি স্তর খালি থাকলে পুরো বিশ্লেষণ অবৈধ; ফরম্যাট-প্রসঙ্গ ছাড়া সংখ্যা অর্থহীন, আর স্যাম্পল ছোট হলে ফলাফল প্রতারক। **মূল তথ্য (৩–৫ বুলেট):** - ফরম্যাট (টেস্ট/ওয়ানডে/টি-টোয়েন্টি/দ্য হান্ড্রেড) নির্ধারণ ছাড়া কোনো ক্রিকেট ডেটা বিশ্লেষণ করা যায় না। - ছোট স্যাম্পল জোরে চিৎকার করে, বড় স্যাম্পল সৎ থাকে — একটি ইনিংস কখনো ফর্ম প্রমাণ করে না। - খালি ডেটা নিরপেক্ষ দেখায়, কিন্তু মস্তিষ্ক ফাঁকা জায়গা ভুল ধারণা দিয়ে পূরণ করে। - পারস্পরিক সম্পর্ক (correlation) কখনো কারণ (causation) নয় — টানা পাঁচ জয়ের পেছনে টস বা প্রতিপক্ষের দুর্বলতা থাকতে পারে। - বিশ্লেষককে নিজের মডেলের অনুমান, ত্রুটি-সীমা ও ফালসিফিকেশন-শর্ত স্পষ্ট লিখতে হবে। **উৎস:** স্টেজ-২ ডিপ প্রফেশনাল বিশ্লেষণ প্রতিবেদন (ইনপুট খালি/শূন্য হিসাবে চিহ্নিত) | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: ফরম্যাট আলাদা না করলে কী ক্ষতি হয়? উত্তর: একই বোলারের ওয়ানডে ও টি-টোয়েন্টি ইকোনমি গড়ে ফেললে যে মধ্যমান আসে, তা কোনো ফরম্যাটেই সত্য নয়। প্রশ্ন: খালি ডেটা কেন বিপজ্জনক? উত্তর: কারণ খালি রিপোর্ট সম্পূর্ণ দেখালে ব্যবহারকারী ভুল সিদ্ধান্ত নেন, যা তথ্যের অনুপস্থিতিকে উপস্থিতির ছদ্মবেশ দেয়। প্রশ্ন: একটি সংখ্যা কখন বিশ্বাসযোগ্য? উত্তর: যখন তার উৎস, ফরম্যাট, স্যাম্পল, ভূমিকা ও ম্যাচ-অবস্থা পর্যন্ত টেনে নেওয়া যায় (cricsultan.com Player Depth Index)।
সিডনির ফ্ল্যাটে রাত তখন এগারোটা। ল্যাপটপের পর্দায় ডেটা-পাইপলাইন শেষ ধাপে গিয়ে থেমে গেছে। যে টেবিলে ফরম্যাট, স্যাম্পল, ভূমিকা আর ম্যাচ-অবস্থার ঘর থাকার কথা, সেখানে সারি সারি খালি ঘর — কোনো স্কোর নেই, কোনো ওভার-বণ্টন নেই, কোনো পিচ-রিপোর্ট নেই। অথচ রিপোর্টটা দেখতে একেবারে নিখুঁত। শিরোনাম থেকে উপসংহার পর্যন্ত সব ঠিকঠাক বিন্যস্ত, বুলেট পয়েন্টগুলো নিজের জায়গায় বসানো, শব্দগুলো শান্ত ও আত্মবিশ্বাসী। কিন্তু ভেতরে একটিও সংখ্যা নেই। আমি চা-এর কাপ নামিয়ে রেখে পেছনে হেলান দিলাম। আমার নINE বছরের কাজের অভিজ্ঞতায় শিখেছি, সবচেয়ে বিপজ্জনক রিপোর্ট সেইটা নয় যেটা ফাঁকা দেখায়; সবচেয়ে বিপজ্জনক রিপোর্ট সেইটা যেটা ফাঁকা হয়েও সম্পূর্ণ বলে চালিয়ে দেওয়া যায়।
আমি তথ্য-নির্ভর ক্রিকেট বিশ্লেষক। আমার কাজ হলো সংখ্যাকে ক্রিকেটের বিশৃঙ্খল বাস্তবতার সামনে দাঁড় করানো — সেটা xG হোক, গড় হোক, স্ট্রাইক রেট হোক, কিংবা বোলিং-ইকোনমি। আজকের এই খালি টেবিল আমাকে একটা পুরোনো শিক্ষা মনে করিয়ে দিল, যা আমি ২০১৮ সালে সিডনির বেডরুমে প্রথম শিখেছিলাম: একটা সংখ্যা তখনই মূল্যবান, যখন সেটাকে তার জন্ম-শর্ত পর্যন্ত টেনে নিয়ে যাওয়া যায়। যে সংখ্যার উৎস খুঁজে পাওয়া যায় না, সেটা সংখ্যা নয় — সেটা শুধু আত্মবিশ্বাসের ছলনা। আজকের নিবন্ধে আমি সেই শৃঙ্খল নিয়ে লিখব — ক্রিকেট বিশ্লেষণে ফরম্যাট, স্যাম্পল, ভূমিকা, পরিবেশ ও ম্যাচ-অবস্থার পাঁচ স্তরের ভেরিফিকেশন, আর তার সামনে দাঁড়ানো সবচেয়ে বড় ফাঁদ, যার নাম খালি ডেটা।
২০১৮ সালে, সতেরো বছর বয়সে, আমি রাশিয়া বিশ্বকাপের প্রতিটি ম্যাচ সিডনির বেডরুম থেকে দেখেছিলাম এবং এক্সেলে আমার প্রথম xG মডেল বানিয়েছিলাম। ১,২৪৮টি শট লগ করেছিলাম হাতে। ফ্রান্স আর্জেন্টিনাকে ৪-৩ হারিয়েছিল, যেখানে ফ্রান্স ২.১ xG থেকে ৪ গোল পেয়েছিল আর আর্জেন্টিনা ১.৪ xG থেকে ৩। ক্রোয়েশিয়া ফাইনাল পর্যন্ত গিয়েছিল ১০.৮ xG থেকে ১৪ গোল করে, যার ৬টিই সেট-পিস থেকে। ডেটা আমার চোখের সাক্ষ্যকে প্রত্যাখ্যান করেছিল। সেই রাতেই আমি বুঝেছিলাম, সংখ্যা এবং ক্রিকেট — দুটো আলাদা ভাষা, এবং আমি মধ্যস্থতাকারীর কাজ করি। সেই থেকেই আমার পদ্ধতি: মডেল একটা দাবি করে, দৃশ্যমান ম্যাচ-প্রসঙ্গ তার বিপরীত দাবি হাজির করে, আর আমি দুটোকে স্যাম্পল, ফরম্যাট, পিচ, ভূমিকা ও ম্যাচ-অবস্থার সামনে যাচাই করি।
এই লেখাটা সেই পদ্ধতিরই একটি বিস্তারিত পাঠ, যা একটি ব্যর্থ ডেটা-পাইপলাইনের ছায়া থেকে জন্ম নিয়েছে — যেখানে বিশ্লেষণের কাঠামো পুরোপুরি ছিল, কিন্তু প্রমাণ ছিল শূন্য। আমি সেটাকেই আজ একটি সুযোগ হিসেবে নিচ্ছি, কারণ শূন্যতা আমার কাছে সবসময় সততার আয়না।
ক্রিকেট বিশ্লেষণের প্রথম দরজা হলো ফরম্যাট। এই কথাটা যত সহজ শোনায়, তত কঠিন এর প্রতিক্রিয়া। টেস্ট, ওয়ানডে, টি-টোয়েন্টি আর দ্য হান্ড্রেড — এই চার ফরম্যাটে ক্রিকেটের গতি, ঝুঁকি আর কৌশল মৌলিকভাবে আলাদা। একই ব্যাটসম্যান, একই বোলার, একই ভেন্যু — তবু ফরম্যাট বদলে গেলে তার সংখ্যাগুলো সম্পূর্ণ ভিন্ন অর্থ বহন করে। যেখানে টেস্টে দিনের পর দিন ধৈর্য ধরে ব্যাটিং করাটাই সাফল্য, সেখানে টি-টোয়েন্টিতে ডট-বলের পর ডট-বল মানে ম্যাচ হারার সূচনা। যে বোলার টেস্টে নতুন বলের স্পেল ছুড়ে উইকেটের পেছনে চাপ তৈরি করেন, তাঁকে টি-টোয়েন্টির ডেথ ওভারে নিয়ে গেলে তাঁর অর্থনমি-রেট আকাশে উড়ে যায়। ফরম্যাট হলো সেই ছাঁচ, যা ছাড়া কোনো সংখ্যা গড়া যায় না।
আমি যখন কোনো নতুন ডেটাসেট হাতে পাই, আমার প্রথম প্রশ্ন কখনোই 'কার সংখ্যা ভালো' নয়। আমার প্রথম প্রশ্ন — 'এটা কোন ফরম্যাটের সংখ্যা, এবং কোন সময়ের?' কারণ ফরম্যাট নির্ধারণ না করে বিশ্লেষণ শুরু করা মানে এমন একটা বাড়ি বানানো যার ভিত্তি নেই। আর সেটাই আমার এইমাত্র হাতে পাওয়া রিপোর্টে ঘটেছে। ডেটা-পাইপলাইনে শুধু 'cricket_asia' লেখা ছিল — একটি আঞ্চলিক ট্যাগ, কোনো ফরম্যাট-ফ্ল্যাগ নেই। টেস্ট, ওয়ানডে, টি-টোয়েন্টি — কোনটা? এই একটা প্রশ্নের উত্তর ছাড়া বাকি সব উত্তর অর্থহীন।
ভাবুন তো, একটি ব্যাটসম্যানের টি-টোয়েন্টিতে ১৪০-এর স্ট্রাইক রেট আপনি টেস্টের প্রেক্ষাপটে বিচার করলে কী হয়। টেস্টে ১৪০ স্ট্রাইক রেট আক্রমণাত্মক, প্রায় আত্মঘাতীও বটে — কারণ টেস্টের মুদ্রা রান নয়, বল। আর টি-টোয়েন্টিতে ১৪০ স্ট্রাইক রেট এখন প্রায় ন্যূনতম মান। একই সংখ্যা দুই ফরম্যাটে দুই সম্পূর্ণ ভিন্ন গল্প বলে। যে বিশ্লেষক ফরম্যাট আলাদা না করে এই দুই সংখ্যা পাশাপাশি রাখেন, তিনি ক্রিকেট বুঝছেন না — তিনি শুধু অঙ্ক করছেন।
আন্তর্জাতিক ক্রিকেটে এই ভুলের বড় উদাহরণ প্রতিনিয়ত দেখা যায়। কোনো ব্যাটসম্যান ওয়ানডেতে গড়ে ৫০+ রান করেন, কিন্তু টেস্টে তাঁর গড় ৩০-এর নিচে। আবার কেউ টি-টোয়েন্টিতে বিধ্বংসী ওপেনার, কিন্তু ওয়ানডেতে তাঁর গেম বিল্ড করার ক্ষমতা প্রশ্নবিদ্ধ। কেউ ওয়ানডের ডেথ-ওভারে দুর্দান্ত, কিন্তু টেস্টে প্রথম সেশনেই পরিশ্রান্ত হয়ে যান। এই পার্থক্যগুলো ফরম্যাট আলাদা না করলে চাপা পড়ে যায় — আর চাপা পড়া পার্থক্য হলো ভুল বাজির সবচেয়ে বড় উৎস।
আমি একবার একটি ক্লায়েন্টের জন্য একটি 'অল-ফরম্যাট' প্রোফাইল বানাতে গিয়ে দেখেছিলাম, একই বোলারের ওয়ানডে ইকোনমি ৪.৮ আর টি-টোয়েন্টিতে ৮.৯। যদি এই দুই সংখ্যাকে একসাথে গড়ে ফেলা হতো, ফল হতো ৬.৮ — এমন একটা সংখ্যা যা কোনো ফরম্যাটেই সত্য নয়। এই ভুয়া মধ্যমানই হলো ফরম্যাট-অবহেলার বিষ। ক্রিকেটে সংখ্যা মিথ্যা বলে না, কিন্তু ফরম্যাট মিশিয়ে ফেললে সংখ্যা অর্ধেক সত্য হয়ে যায়। আর অর্ধেক সত্য ক্রিকেটে সবচেয়ে বিপজ্জনক মিথ্যা।
এখন আসি দ্বিতীয় স্তরে — স্যাম্পল। স্যাম্পল ছোট হলে সংখ্যা চিৎকার করে; স্যাম্পল বড় হলে সংখ্যা সৎ হয়। এই কথাটা আমি প্রতিদিন মনে করি। একজন ব্যাটসম্যানের তিন ম্যাচে ৮০-এর গড় আর পঞ্চাশ ম্যাচে ৪৫-এর গড় — এদের মধ্যে কোনটা বেশি বিশ্বাসযোগ্য? নির্বাচন-পক্ষপাত এবং ভাগ্যের কম্পন ছোট স্যাম্পলে বিশাল হয়ে ওঠে। একটি ইনিংসের ১০০ রান ব্যাটসম্যানের দক্ষতার চেয়ে প্রায়ই সেদিনের পিচ, বোলারদের মান আর ড্রপ-ক্যাচের ফল। কিন্তু মডেল যদি শুধু ইনিংসের স্কোর দেখে, সে বলবে — 'দুর্দান্ত ফর্ম।' আর সেখান থেকেই ভুল বাজি জন্ম নেয়।
আমি ২০২২ সালে কাতার বিশ্বকাপে এই শিক্ষার বড় প্রয়োগ দেখেছিলাম, সেটা ফুটবল হলেও পদ্ধতি এক। আর্জেন্টিনা সৌদি আরবের কাছে ১-২ হেরে গিয়েছিল। আর্জেন্টিনা ২.৩ xG তৈরি করেছিল, ১৫টি শট নিয়েছিল; সৌদি আরব ০.৩ xG থেকে দুই গোল করেছিল। আর্জেন্টিনাকে ১০ বার অফসাইডে ধরা হয়েছিল। অনেকে বলেছিলেন, আর্জেন্টিনা শেষ। আমি প্যানিক করিনি; বরং ধীরে ধীরে ৩৬টি শট আর অফসাইড-ট্র্যাপ পুনর্মূল্যায়ন করেছিলাম। ডেটা দেখিয়েছিল, আর্জেন্টিনার হাই লাইন ঝুঁকিপূর্ণ, কিন্তু ফলটি ছিল ভেরিয়েন্স। সেই ইনিংসটাই আমার সবচেয়ে বেশি শেয়ার হওয়া লেখার জন্ম দিয়েছিল — 'ভেরিয়েন্স বনাম প্রসেস', যেখানে আমি বাজিকরদের সতর্ক করেছিলাম একটি ফলাফল দেখে অতিরিক্ত প্রতিক্রিয়া না দেখাতে।
ক্রিকেটে এই একই নীতি আরও স্পষ্ট। একটি টেস্ট ম্যাচে কোনো ব্যাটসম্যান ২৫ বলে ০ রানে আউট হলে মডেল চিৎকার করে — 'ব্যর্থ।' কিন্তু যদি দেখেন, সেই পিচে প্রথম সেশনে বল সুইং করছিল, পাঁচটি এজ-বল ফিল্ডার ধরতে পারেনি, আর সেই ব্যাটসম্যান দলের হয়ে সবচেয়ে বেশি বল খেলেছিলেন — তখন গল্পটা বদলে যায়। স্যাম্পল যদি বড় হয়, ব্যাটসম্যানের কেরিয়ার-গড় এই এক ম্যাচের চিৎকার চাপা দেয়। কিন্তু যদি স্যাম্পল ছোট হয়, চিৎকারটাই সত্য বলে চালিয়ে দেওয়া হয়।
তৃতীয় স্তর হলো ভূমিকা — বা রোল। ক্রিকেটে খেলোয়াড়ের সংখ্যা তার ভূমিকা থেকে আলাদা করা যায় না। একজন ওপেনার, একজন অ্যাংকর, একজন ফিনিশার, একজন নিউ-বল পেসার, একজন ডেথ-ওভার স্পেশালিস্ট, একজন কিপার-ব্যাটসম্যান — প্রত্যেকের সাফল্যের সংজ্ঞা আলাদা। ফিনিশারের কাজ স্ট্রাইক রেট, অ্যাংকররের কাজ বিল্ডিং ও বল খেয়ে ফেলা, নিউ-বল পেসারের কাজ নতুন বলের সুইং কাজে লাগানো। একই ব্যাটসম্যান চার নম্বরে যাওয়ার পর আর ছয় নম্বরে যাওয়ার পর দুই আলাদা খেলোয়াড়।
আমি যখন কোনো ব্যাটসম্যানের টি-টোয়েন্টি স্ট্রাইক রেট দেখি, আমি সাথে সাথে তাঁর ব্যাটিং পজিশন দেখি। একজন পাঁচ নম্বরের ব্যাটসম্যান যিনি প্রায়ই শেষ পাঁচ ওভারে নামেন, তাঁর স্ট্রাইক রেট চার নম্বরের ব্যাটসম্যানের সাথে তুলনা করা অন্যায়। কারণ তাদের সামনে বলের সংখ্যা, ফিল্ড-সেটিং আর প্রয়োজনীয় ঝুঁকির মাত্রা আলাদা। ভূমিকা আলাদা না করে সংখ্যা তুলনা করলে আপনি আসলে টেনিসের স্কোর আর ক্রিকেটের স্কোর পাশাপাশি রাখছেন।
এই ভূমিকা-প্রসঙ্গ আমার কাছে খুব ব্যক্তিগত, কারণ আমি নিজে একবার একটি ট্রান্সফার-ব্রিফে ভুল করতে যাচ্ছিলাম। ২০২৪ সালের সামার ট্রান্সফার উইন্ডোতে আমি হুলিয়ান আলভারেজের অ্যাটলেটিকো মাদ্রিদে ৭৫ মিলিয়ন ইউরোর চুক্তি নিয়ে একটি ডেটা-ব্রিফ বানিয়েছিলাম। সেখানে আমি তাঁর ০.৪৮ xG প্রতি ৯০ মিনিট আর প্রেসিং-সংখ্যা ব্যবহার করেছিলাম। প্রাথমিকভাবে আমি তাঁর ভূমিকা ঠিকমতো বুঝিনি — তিনি ম্যানচেস্টার সিটিতে প্রায়ই বদলি হিসেবে খেলতেন, এবং যখন শুরু থেকে খেলতেন তখন তাঁর সংখ্যা বদলে যেত। যখন আমি ভূমিকা-সমন্বিত করলাম, তখন চিত্রটা স্পষ্ট হলো। যদি খেলোয়াড়ের ভূমিকা না বুঝে তার মোট গোল দেখতাম, আমি ভুল উপসংহারে পৌঁছাতাম।
ক্রিকেটে এই ভূমিকা-শৃঙ্খল আরও জরুরি। একজন বোলার যিনি পাওয়ারপ্লে-তে বল করেন, তাঁর ইকোনমি ডেথ-ওভারের বোলারের সাথে তুলনা করা যায় না। পাওয়ারপ্লেতে ফিল্ড-আপ থাকে, তাই রান কম; ডেথ ওভারে ফিল্ড-ডাউন থাকে, তাই ঝুঁকি বেশি। যদি কেউ শুধু ইকোনমি দেখে সিদ্ধান্ত নেন, তিনি ভুল বোলারকে বেছে নেবেন। আমি কখনো কোনো বোলারের সংখ্যা দেখি না যতক্ষণ না জানি তিনি কোন ফেজে বল করেন।
চতুর্থ স্তর — পরিবেশ ও শর্ত। ক্রিকেটের পিচ, আবহাওয়া, শিশির, বাতাস আর দিনের আলো — এই সবকিছুই সংখ্যার অর্থ বদলে দেয়। একটি টি-টোয়েন্টি ম্যাচে দিনের প্রথম ইনিংসে যে ব্যাটসম্যান ১৬০ স্ট্রাইক রেটে খেলেন, তিনি সন্ধ্যার শিশিরে একই রকম খেলতে পারবেন না — কারণ বল হাত থেকে বেরিয়ে স্লিপ করছে, স্পিনার গ্রিপ পাচ্ছেন না। পিচ যদি ধীর হয়, ডেথ-ওভারে ১৮০ স্ট্রাইক রেট অলৌকিক; পিচ যদি ব্যাটিং-বান্ধব হয়, সেই একই ১৮০ স্বাভাবিক।
আমি ২০২০ সালে এই শিক্ষার একটি অনন্য রূপ দেখেছিলাম, সেটাও ফুটবলে, কিন্তু নীতিটা সরাসরি ক্রিকেটে প্রযোজ্য। কোভিড-হিয়েটাসে জার্মান বুন্দেসলিগা প্রজেক্ট রেস্টার্টের প্রথম পাঁচ রাউন্ডে হোম-উইন শতাংশ ৪৩.৩% থেকে ৩৩.৩%-এ নেমে এসেছিল। সিডনি এফসি খালি ব্যাংকওয়েস্ট স্টেডিয়ামে মেলবোর্ন সিটিকে ১-০ হারিয়েছিল। PPDA আর কভার-করা দূরত্ব ব্যবহার করে দেখলাম, হোম-অ্যাডভান্টেজ ০.২৫ xG কমে গেছে। সেই সময়েই আমি আমার বাজি-মডেলগুলো ভিড়ের অনুপস্থিতির জন্য সমন্বয় করতে শুরু করি। আমি একটি বিশ্ববিদ্যালয়ের গবেষণাপত্র লিখেছিলাম 'প্রসঙ্গ-সমন্বিত xG' নিয়ে, যেখানে যুক্তি দিয়েছিলাম — ডেটা মিথ্যা বলে না, কিন্তু প্রসঙ্গ তার অর্থ বদলে দেয়।
এই কথাটাই ক্রিকেটে আরও সত্য। ২০২১ সালে ইউরো আর টোকিও অলিম্পিক্সে ইতালির প্রেসিং-ব্লুপ্রিন্ট আমি বিশ্লেষণ করেছিলাম। ফাইনালে ইতালি ইংল্যান্ডকে হারিয়েছিল ৬৫% পজেশন, ১৯ শট আর ২.১ xG নিয়ে, বিপক্ষে ইংল্যান্ডের ০.৮ xG। জর্জিনিয়ো প্রতি ম্যাচে ১২.৯ কিমি কভার করতেন, আর ইতালির PPDA ছিল ৮.৭; তারা সাত ম্যাচে মাত্র চার গোল খেয়েছিল। কিন্তু একজন ISTJ হিসেবে আমি সতর্কভাবে প্রশ্ন করেছিলাম — এই প্রেসিং কি একটা পুরো মৌসুম ধরে টিকবে? আমি লিখেছিলাম, কৌশলগত আবিষ্কারকে একটি টুর্নামেন্ট নয়, পুনরাবৃত্তিযোগ্য ডেটা দিয়ে বিচার করতে হবে।
ক্রিকেটে পরিবেশ-শর্তের সবচেয়ে বড় উদাহরণ শিশির আর পিচ-ক্ষয়। একটি ওয়ানডে ম্যাচে প্রথম ইনিংসে ৩০০ রান হয়, দ্বিতীয় ইনিংসে শিশিরের কারণে বল গ্রিপ করে না, স্পিনাররা নিষ্ক্রিয়, ফলে স্কোর হয় ৩০১। যারা শুধু 'প্রথম ব্যাটিং অসুবিধা' বা 'দ্বিতীয় ব্যাটিং সহজ' — এই ধরনের সার্বজনীন সূত্রে বিশ্বাস করেন, তারা ম্যাচের নির্দিষ্ট শর্ত ভুলে যান। একই ভেন্যুতে, একই দল, ভিন্ন দিন — সম্পূর্ণ ভিন্ন ফল। পরিবেশ-শর্ত না মিলিয়ে কোনো সংখ্যা চূড়ান্ত নয়।
পঞ্চম স্তর, এবং আমার কাছে সবচেয়ে গুরুত্বপূর্ণ — ম্যাচ-অবস্থা। এখানে আমি 'গেম স্টেট' বা ম্যাচ-অবস্থার কথা বলছি। একটি ম্যাচের ফলাফল নির্ধারিত হয় তার গতিপ্রকৃতির ওপর — কে আগে রান করছে, কত উইকেট পড়েছে, কত ওভার বাকি, কত প্রয়োজন। ক্রিকেটে এই ম্যাচ-অবস্থা ব্যাটসম্যানের ভূমিকা বদলে দেয়। যে ব্যাটসম্যান দুই উইকেট পড়ে মাঠে নামেন, তাঁর কাজ বিল্ড করা; যে ব্যাটসম্যান শেষ পাঁচ ওভারে নামেন, তাঁর কাজ আক্রমণ করা। একই ব্যাটসম্যান দুই অবস্থায় দুই ধরনের খেলা খেলেন।
আমি প্রতিটি রিপোর্টে ম্যাচ-অবস্থা পরিমাপ করি, কারণ আমি বিশ্বাস করি — টেবিলের অবস্থান আর একটি ম্যাচের প্রকৃত গতি কখনো এক জিনিস নয়। একটি দল টেবিলে দ্বিতীয় হতে পারে, কিন্তু তাদের সাম্প্রতিক পাঁচ ম্যাচের গতিপ্রকৃতি ভয়ানক হতে পারে। নিয়মিত মৌসুমের সবচেয়ে বড় সত্য হলো — টেবিল শুধু ফলাফল জমা করে, গতি নয়। আর গতিই ভবিষ্যৎ বলে দেয়।
এই পাঁচ স্তর — ফরম্যাট, স্যাম্পল, ভূমিকা, পরিবেশ, ম্যাচ-অবস্থা — মিলেই গঠন করে আমার ভেরিফিকেশন-শৃঙ্খল। আমি এটাকে 'চেইন' বলি কারণ প্রতিটি স্তর আগেরটির ওপর নির্ভরশীল। যদি ফরম্যাট স্তরে ভুল থাকে, স্যাম্পল স্তরের সঠিকতাও অর্থহীন। যদি স্যাম্পল ছোট হয়, ভূমিকা স্তরের সূক্ষ্মতা কাজে আসে না। এটা একটা শৃঙ্খল, আর শৃঙ্খলের সবচেয়ে দুর্বল কড়িটাই তার শক্তি নির্ধারণ করে।
এই শৃঙ্খলের ধারণাটাই আমার কাছে আজকের সবচেয়ে বড় শিক্ষার জন্ম দিয়েছে। কারণ আজ হাতে পাওয়া রিপোর্টটিতে প্রতিটি স্তর বিন্যস্ত ছিল, কিন্তু শৃঙ্খলের প্রথম কড়িটাই ছিল খালি। 'cricket_asia' — একটি আঞ্চলিক ট্যাগ। ফরম্যাট নেই, স্যাম্পল নেই, খেলোয়াড় নেই, ভেন্যু নেই, সময় নেই। এর মানে হলো, বিশ্লেষণের কাঠামোটা সম্পূর্ণ ছিল, কিন্তু তার মধ্যে কোনো প্রমাণ ঢোকানো হয়নি।
এখানেই আমার লেখার সবচেয়ে গুরুত্বপূর্ণ, এবং সবচেয়ে বিপরীতমুখী পর্যবেক্ষণ। যে রিপোর্ট খালি, সেটা বিপজ্জনক নয় — কারণ খালি রিপোর্ট কেউ বিশ্বাস করে না। বিপজ্জনক হলো সেই রিপোর্ট, যেটা খালি হয়েও দেখতে সম্পূর্ণ। আজকের কাঠামোতে প্রতিটি ঘর পূরণ করা হয়েছিল 'N/A — অপর্যাপ্ত তথ্য' দিয়ে। প্রথমে ভাবলাম, এটা ঠিক আছে, এটা সততার চিহ্ন। কিন্তু তারপর বুঝলাম আসল বিপদটা অন্য জায়গায়।
ভাবুন তো, একজন ডাউনস্ট্রিম ব্যবহারকারী — ধরুন একজন বাজিকর বা একজন সম্পাদক — এই রিপোর্টটা হাতে পান। তিনি শিরোনাম দেখেন, বুলেট দেখেন, বিশ্লেষণী ভাষা দেখেন। তিনি ধরে নেন রিপোর্টটা সম্পূর্ণ। তিনি 'N/A' গুলোকে 'বিশ্লেষণের সূক্ষ্মতা' ভেবে উড়িয়ে দেন। আর তারপর সেই খালি ভিত্তির ওপর ভর করে সিদ্ধান্ত নেন। এই অবস্থাটাই সবচেয়ে ভয়ংকর, কারণ এখানে তথ্যের অভাব তথ্যের উপস্থিতির ছদ্মবেশ ধারণ করে।
এই ঘটনাটা আমার কাছে খুব চেনা। আমি বাজি-বিশ্লেষক হিসেবে বারবার দেখেছি, কীভাবে একটি আত্মবিশ্বাসী ভাষার মোড়ক একটা দুর্বল বিশ্লেষণকে শক্তিশালী দেখায়। একটা শান্ত, আত্মবিশ্বাসী, বিন্যস্ত ভাষা মস্তিষ্ককে বিশ্বাস করায় — 'যদি এত গুছিয়ে বলা হয়েছে, তবে নিশ্চয়ই এর পেছনে ডেটা আছে।' কিন্তু ক্রিকেটে, আর জীবনে, গুছানো ভাষা আর সত্যিকারের প্রমাণ কখনো এক নয়।
এখানেই আমি একটা বড় সতর্কবার্তা দিতে চাই, যা ক্রিকেট-বিশ্লেষণ ও বাজি — দুই জায়গাতেই প্রযোজ্য। পারস্পরিক সম্পর্ক (correlation) আর কারণ (causation) কখনো এক নয়। একটি দল যদি টানা পাঁচ ম্যাচ জিতে যায়, অনেকে ধরে নেন তারা 'ফর্মে'। কিন্তু যদি দেখেন সেই পাঁচ ম্যাচের তিনটে টসে জিতে প্রথমে ফিল্ডিং করেছিল, দুটো ম্যাচে প্রতিপক্ষের দুই সিনিয়র খেলোয়াড় চোটে ছিলেন — তাহলে 'ফর্ম' শব্দটা ভুল। জেতার কারণ হয়তো টস, হয়তো প্রতিপক্ষের দুর্বলতা, হয়তো ভাগ্য। কিন্তু মডেল যদি শুধু 'পাঁচ জয়' দেখে, সে ভুল গল্প বলে।
আমি এই বিভ্রান্তি নিজে হাড়ে হাড়ে টের পেয়েছি। ২০১৮ সালে যখন আমি প্রথম xG মডেল বানিয়েছিলাম, আমি ভাবতাম সংখ্যা মানেই সত্য। কিন্তু সময়ের সাথে সাথে শিখেছি — সংখ্যা একটা দাবি, সত্য নয়। ফ্রান্স ২.১ xG থেকে ৪ গোল করেছিল — এটা কি মানে ফ্রান্সের ফিনিশিং অসাধারণ? নাকি মানে গোলকিপার খারাপ ছিল? নাকি মানে দুই-তিনটে শট অলৌকিকভাবে জালে ঢুকেছিল? এই প্রশ্নগুলো না করে শুধু 'ফ্রান্স ভালো ফিনিশার' বলা — এটাই মডেল-পূজা, যা আমি এড়িয়ে চলি।
ক্রিকেটে এই পারস্পরিক-সম্পর্কের ফাঁদ আরও সূক্ষ্ম। একটি ব্যাটসম্যানের 'ফর্ম' প্রায়ই তার প্রতিপক্ষের গুণমানের ওপর নির্ভর করে। যদি তিনি টানা তিন ম্যাচে ৫০+ করেন, কিন্তু সেই তিন ম্যাচই হয় দ্বিতীয়-সারির বোলিং-আক্রমণের বিপক্ষে, তাহলে সংখ্যাটা প্রতারক। বড় প্রতিপক্ষের সামনে তিনি কেমন করবেন — সেটা সংখ্যায় ধরা পড়ে না, যদি না আপনি প্রতিপক্ষের গুণমান দিয়ে সমন্বয় করেন। তাই আমি কখনো শুধু রান বা উইকেট দেখে থামি না; আমি দেখি কে ছিলেন সামনে।

এই কারণেই আমি আমার নিজের মডেলকেও সন্দেহ করি। একটি মডেল যখন কোনো খেলোয়াড়কে অতিরিক্ত উচ্চ বা অতিরিক্ত নিচু রেটিং দেয়, আমার প্রথম কাজ — মডেলকে প্রশ্ন করা। তার ভিত্তি কী? স্যাম্পল কত বড়? ফরম্যাট কী? ভূমিকা কী? এই প্রশ্নগুলো না করে মডেলের ফলাফল মেনে নেওয়া মানে মডেলকে ঈশ্বর বানানো। আর আমি ঈশ্বর বানাই না; আমি মডেলকে একটা সাক্ষী হিসেবে দেখি, যাকে জেরা করা যায়।
সেই জেরার সবচেয়ে শক্তিশালী হাতিয়ার হলো সন্দেহের শৃঙ্খলা। আমি সবসময় ধরে নিই, একটি সংখ্যা ভুল হতে পারে, যতক্ষণ না সে নিজেকে প্রমাণ করে। এই দৃষ্টিভঙ্গি অনেকের কাছে হতাশাবাদী মনে হতে পারে। কিন্তু আমার কাছে এটাই আশাবাদ — কারণ যখন একটি সংখ্যা সব জেরা পেরিয়ে টিকে থাকে, তখন আমি তাকে ভরসা করতে পারি। যাচাইয়ের আগে বিশ্বাস করা আর যাচাইয়ের পরে বিশ্বাস করা — এই দুইয়ের মধ্যে আকাশ-পাতাল পার্থক্য।
আমি এই নীতিটা ২০২৪ সালের ইউরো ও প্যারিস অলিম্পিক্স কভার করার সময় আরও দৃঢ়ভাবে অনুসরণ করেছিলাম। স্পেন ইংল্যান্ডকে ২-১ হারিয়েছিল ইউরো ফাইনালে, স্পেন ২.০ xG আর ইংল্যান্ড ০.৮। অনেক মডেল স্পেনকে অতিরিক্ত উচ্চ রেটিং দিয়েছিল। আমি সেই রেটিং জেরা করেছিলাম — স্পেনের সাফল্য কি সিস্টেমের ফল, নাকি কয়েকজন তারকার ব্যক্তিগত দক্ষতার? যদি ব্যক্তিগত দক্ষতার হয়, তবে সেই সাফল্য পুনরাবৃত্তিযোগ্য নয়। এই প্রশ্নটা ক্রিকেটেও সমান প্রযোজ্য।
ক্রিকেটে এই 'সিস্টেম বনাম তারকা' প্রশ্নটা বারবার ফিরে আসে। একটি দল টুর্নামেন্ট জেতে যদি তাদের দুই-তিনজন তারকা অসাধারণ ফর্মে থাকেন, তাহলে সেই জয় কি দলের সিস্টেমের, নাকি তারকাদের? যদি পরের টুর্নামেন্টে সেই তারকারা ফর্ম হারান আর দল হেরে যায়, তখন বোঝা যায় সিস্টেমটা আসলে টেকসই ছিল না। আমার কাছে টেকসই সিস্টেমের সংজ্ঞা হলো — যখন তারকা না থাকলেও দল জেতে। এই পরীক্ষাটাই আমি প্রতিটি 'উত্থান' বিশ্লেষণে প্রয়োগ করি।
এই জায়গায় আমি একটা সাধারণ ভুল নিয়ে কথা বলতে চাই, যা নতুন বিশ্লেষকরা প্রায়ই করেন — পদ্ধতি অতিরিক্ত ব্যাখ্যা করা। আমি নিজেও ISTJ, আমার স্বভাবই সূক্ষ্ম, বিস্তারিত, প্রতিটি সংজ্ঞা নির্ভুল করার প্রবণতা। কিন্তু আমি শিখেছি, পাঠককে প্রথমে একটি সরল ভাষায় ফলাফল দিতে হয়, তারপর সূক্ষ্মতা। যদি শুরুতে আমি PPDA, xG, ইকোনমি, স্ট্রাইক রেট — সব সংজ্ঞা দিয়ে শুরু করি, পাঠক হারিয়ে যান। তাই আমার নিয়ম — প্রথমে একটি স্পষ্ট কথা, তারপর ধীরে ধীরে স্তরগুলো খুলে দেওয়া।
এই শৃঙ্খলাটাই আজকের লেখার কেন্দ্র। কারণ হাতে পাওয়া রিপোর্টটি ছিল উল্টো — পুরো কাঠামো সূক্ষ্ম, কিন্তু ভেতরে কোনো সরল সত্য ছিল না। এটা সেই ফাঁদেরই আরেক রূপ — সূক্ষ্মতা যেখানে প্রমাণের অভাব ঢেকে দেয়।
এখন আসি সবচেয়ে জরুরি জায়গায় — খালি ডেটার ফাঁদ আসলে কেন এত বিপজ্জনক? আমি তিনটি কারণে এটাকে ভয়ংকর মনে করি। প্রথমত, খালি ডেটা নিরপেক্ষ দেখায়। একটি ভুল ডেটা চোখে পড়ে, কারণ সেটা একটা দাবি করে যা খণ্ডন করা যায়। কিন্তু খালি ডেটা কোনো দাবিই করে না; সে শুধু ফাঁকা থাকে। আর ফাঁকা জায়গা মস্তিষ্ক নিজে থেকে পূরণ করে ফেলে — প্রায়ই ভুল ধারণা দিয়ে। দ্বিতীয়ত, খালি ডেটা আত্মবিশ্বাসের মোড়কে এলে সেটা তথ্যের মতো শোনায়। তৃতীয়ত, আর সবচেয়ে ভয়ংকর — খালি ডেটা ভবিষ্যতের ভুলের ভিত্তি তৈরি করে, যা অনেক পরে ধরা পড়ে, যখন ক্ষতি হয়ে গেছে।
আমি বাজি-বিশ্লেষক হিসেবে এই ফাঁদের বাস্তব ফলাফল দেখেছি। একটা ফাঁকা বা দুর্বল ডেটাসেট থেকে তৈরি 'নিশ্চিত' সুপারিশ অনেক সময় বড় ক্ষতির কারণ হয়। কারণ সংখ্যা না থাকলেও ভাষা ছিল আত্মবিশ্বাসী। আর বাজারে আত্মবিশ্বাসী ভাষা প্রায়ই সংখ্যার চেয়ে বেশি প্রভাব ফেলে। এই কারণেই আমি সবসময় আমার প্রতিটি রিপোর্টে ডেটার উৎস, ফরম্যাট, স্যাম্পল-আকার আর অনিশ্চয়তার মাত্রা স্পষ্ট করে লিখি।
আমি ২০২৫ সালে ক্লাব বিশ্বকাপ মডেল করার সময় এই নীতিটা কাজে লাগিয়েছিলাম। চেলসি পিএসজিকে ৩-০ হারিয়েছিল, কোল পামার দুই গোল করেছিলেন। সেই মডেলে আমি স্পষ্টভাবে লিখেছিলাম, কোন ডেটা কতটা নির্ভরযোগ্য আর কোনটা অনুমান। কারণ আমি জানতাম, একটি টুর্নামেন্ট-ভিত্তিক মডেলে স্যাম্পল ছোট, তাই সতর্কতা জরুরি। আর এখন আমি ২০২৬ সালের যুক্তরাষ্ট্র-কানাডা-মেক্সিকো বিশ্বকাপের জন্য একটি লাইভ xG মডেল প্রস্তুত করছি, যেখানে প্রতিটি সংখ্যার পেছনে ফরম্যাট, শর্ত আর ম্যাচ-অবস্থার ট্যাগ থাকবে।
আমার চূড়ান্ত এবং সবচেয়ে কঠিন নীতি হলো — নিজের মডেলকে তার সীমার বাইরেও রক্ষা না করা। ডেটা-বিশ্লেষকের সবচেয়ে বড় প্রলোভন হলো নিজের বানানো মডেলকে ভালোবেসে ফেলা। কারণ সেই মডেলের পেছনে তার শ্রম, তার রাত জাগা, তার গর্ব থাকে। কিন্তু ভালোবাসা প্রমাণ নয়। আমি যখন কোনো মডেল বানাই, আমি স্পষ্ট করে লিখে রাখি — এর অনুমান কী, এর ত্রুটির সীমা কী, আর কোন শর্তে এটি ভুল প্রমাণিত হবে। এই ফালসিফিকেশন-শর্তটাই আমাকে মডেল-পূজা থেকে বাঁচায়।

ক্রিকেটে এই নীতিটা অপরিহার্য। কারণ ক্রিকেট এমন একটা খেলা, যেখানে একটি বল, একটি ক্যাচ, একটি টস — সবকিছু ফলাফল বদলে দিতে পারে। এই বিশৃঙ্খলার সামনে কোনো মডেলই সম্পূর্ণ হতে পারে না। তাই বিনয়টাই বিশ্লেষকের সবচেয়ে বড় হাতিয়ার। যে বিশ্লেষক জানেন তিনি ভুল হতে পারেন, তিনিই সবচেয়ে কম ভুল করেন।
আমি এই বিনয়টা ২০২০ সালের সেই খালি স্টেডিয়ামের রাতগুলোতে শিখেছিলাম। ভিড় না থাকলে হোম-অ্যাডভান্টেজ কমে গিয়েছিল — এই তথ্যটা আমাকে শিখিয়েছিল, যাকে আমি স্বাভাবিক ভাবতাম, সেটাও প্রসঙ্গের ওপর নির্ভরশীল। ক্রিকেটে ও 'হোম-অ্যাডভান্টেজ' কথাটা প্রায়ই বলা হয়, কিন্তু তার উৎস কী? ভিড়? পিচের পরিচিতি? আম্পায়ারের অবচেতন পক্ষপাত? যদি ভিড় না থাকে, অ্যাডভান্টেজ কি টেকে? এই প্রশ্নটা ক্রিকেটেও প্রযোজ্য, বিশেষত নিরপেক্ষ ভেন্যুতে খেলা টুর্নামেন্টে।
সুতরাং আজকের রিপোর্টের খালি টেবিল আমার কাছে একটা উপহার। এটা আমাকে মনে করিয়ে দিল, আমার কাজ সংখ্যা জোগাড় করা নয়, সংখ্যাকে জেরা করা। এটা আমাকে মনে করিয়ে দিল, ফরম্যাট ছাড়া কোনো বিশ্লেষণ নেই, স্যাম্পল ছাড়া কোনো সিদ্ধান্ত নেই, ভূমিকা ছাড়া কোনো তুলনা নেই, প্রসঙ্গ ছাড়া কোনো সত্য নেই। আর সবচেয়ে বড় কথা — খালি জায়গা কখনো আত্মবিশ্বাস দিয়ে ভরাট করা যায় না।
আমার প্রতিটি লেখায় আমি একটা জিনিস মেনে চলি: আমি এমন কোনো সংখ্যায় ভরসা করি না, যাকে আমি একটি স্পর্শ (touch) পর্যন্ত টেনে নিয়ে যেতে পারি না। এই নীতিটাই আমাকে ক্রিকেট-বাজারের বিশৃঙ্খলায় স্থির রাখে। কারণ বাজার প্রতিদিন চিৎকার করে, আর মডেল কখনো চোখের পলক ফেলে। কিন্তু যে বিশ্লেষক জানেন তাঁর সীমা, তিনি এই চিৎকারের মধ্যে শান্ত থাকতে পারেন।
সামনের দিকে তাকিয়ে, আমার জন্য পরের ধাপটা স্পষ্ট। একটি ব্যর্থ ডেটা-পাইপলাইন আমাকে শিখিয়েছে, বিশ্লেষণের আগে ইনপুট যাচাই করা জরুরি। ঠিক যেমন ক্রিকেটে প্রথম বলে শট খেলার আগে পিচ পড়তে হয়। নিয়মিত মৌসুমে এই ধৈর্যই সবচেয়ে বড় সম্পদ। টেবিলের অবস্থান দেখে চিৎকার করা সহজ; কিন্তু টেবিলের নিচের গতি পড়া কঠিন। আর সেই কঠিন কাজটাই আমার কাজ।
আমি পরের সপ্তাহগুলোতে তিনটি সংকেত নজরে রাখব। প্রথমত, যেসব দলের সাম্প্রতিক পাঁচ ম্যাচের গতিপ্রকৃতি আর টেবিল-অবস্থানের মধ্যে ফাঁক বাড়ছে — সেখানে ভেরিয়েন্স আর প্রসেসের পার্থক্য পরিষ্কার হবে। দ্বিতীয়ত, যেসব বোলার পাওয়ারপ্লে থেকে ডেথ ওভারে ভূমিকা বদলাচ্ছেন — সেখানে ইকোনমির অর্থ বদলে যাবে। তৃতীয়ত, যেসব ব্যাটসম্যান প্রতিপক্ষের মান বদলের সাথে ভিন্ন ফল দেখাচ্ছেন — সেখানে 'ফর্ম' শব্দটি যাচাইয়ের দাবি করবে।
একটা প্রশ্ন আমি পাঠকের সামনে রেখে যেতে চাই। আপনি যখন কোনো ক্রিকেট বিশ্লেষণ পড়েন, আপনি কি সংখ্যাগুলো দেখেন, নাকি সংখ্যাগুলোর পেছনে থাকা ফরম্যাট, স্যাম্পল আর প্রসঙ্গ দেখেন? কারণ আমার অভিজ্ঞতায়, বেশিরভাগ পাঠক প্রথমটা দেখেন, আর সেখানেই ভুলটা লুকিয়ে থাকে। যদি আমরা সংখ্যাকে তার জন্ম-শর্তসহ পড়তে শিখি, তবে ক্রিকেটের প্রতিটি পরিসংখ্যান আমাদের জন্য আরও সৎ হয়ে উঠবে। আর সেই সততাই — খালি টেবিলের মধ্যেও — আমার পরের নিবন্ধের ভিত্তি হবে।
