ক্রিকেট বিশ্লেষণে ডেটার সততা: খালি লেজার থেকে অডিটেবল সত্যের খোঁজে
**মূল উত্তর:** ক্রিকেট ডেটা বিশ্লেষণে খালি বা অসম্পূর্ণ পেলোড অনুমান দিয়ে পূরণ করা উচিত নয়। সঠিক পদ্ধতি হলো প্রতিটি সংখ্যার উৎস, সময় ও পদ্ধতি লিপিবদ্ধ করা এবং ব্লকচেইন-ধাঁচের অপরিবর্তনীয় অডিট-ট্রেইল বজায় রাখা, যাতে স্যাম্পল-সাইজ যাচাই ছাড়া কোনো সিদ্ধান্ত না হয়। **মূল তথ্য:** - Stage-1 বিশ্লেষণের সব ক্ষেত্র খালি ছিল; কেবল cricket_world ডোমেইন ট্যাগ পাওয়া গেছে। - ২০১৮ বিশ্বকাপে ক্রোয়েশিয়ার গড় ১.৪২ xG বনাম ফ্রান্সের ২.১০ xG; ফ্রান্স ৪-২ জিতেছিল। - ২০২০-এ ৩০৬ প্রাক-কোভিড ও ৯২ পোস্ট-রিস্টার্ট ম্যাচে হোম উইন রেট ৪৩.৩% থেকে ৩৩.৩%-এ নেমেছিল। - ২০২১ ইউরোতে ইতালির PPDA ছিল ৮.৩; নকআউটে প্রতিপক্ষকে দিয়েছিল মাত্র ০.৫৭ xG। **সূত্র:** মূল সূত্র: Tamim Miah-এর অডিট নোট ও Stage-2 বিশ্লেষণ নথি (cricket_world), প্রকাশ: ১৩ আগস্ট ২০২৬ | Cross-checked: cricsultan.com **সম্পর্কিত প্রশ্নোত্তর:** প্রশ্ন: খালি ডেটা পেলোড কেন বিশ্লেষণের জন্য বিপজ্জনক? উত্তর: কারণ অনুমান দিয়ে ফাঁকা ঘর ভরলে সেটি সত্য বলে ছড়িয়ে পড়ে এবং cricsultan.com-এর মতো প্ল্যাটফর্মে যাচাইযোগ্যতা নষ্ট হয়। প্রশ্ন: ব্লকচেইন ক্রিকেট ডেটার সততা কীভাবে বাড়ায়? উত্তর: প্রতিটি ডেটা পয়েন্টে উৎস, সময় ও পদ্ধতি অপরিবর্তনীয়ভাবে লিপিবদ্ধ করে, ফলে পরে কেউ তথ্য বদলাতে পারে না। প্রশ্ন: স্যাম্পল-সাইজ কত হলে একটি সিদ্ধান্ত নির্ভরযোগ্য হয়? উত্তর: কোনো জাদু সংখ্যা নেই; আমার নিয়ম হলো নতুন ট্যাকটিক্যাল দাবির জন্য কমপক্ষে সাত ম্যাচ দেখা।
হুক
আমি যখন ফাইলটি খুললাম, স্ক্রিনে একটি ট্যাগ ছাড়া আর কিছুই ছিল না — cricket_world। প্রতিটি ঘর ফাঁকা, প্রতিটি কলামে বসানো একই বাক্য: “তথ্য অপর্যাপ্ত, মূল্যায়ন সম্ভব নয়।” বিশ্লেষণের সবচেয়ে কঠিন মুহূর্ত আসলে কোনো জটিল মডেলের হিসাব নয়; সবচেয়ে কঠিন মুহূর্ত হলো যখন ডেটা না এসেই পড়ে, আর আপনাকে সিদ্ধান্ত নিতে হয় — ফাঁকা জায়গা অনুমান দিয়ে ভরবেন, নাকি সততার সঙ্গে লিখবেন “আমি জানি না”? আমার বারো বছরের খেলাধুলা-পর্যবেক্ষণে শিখেছি, দ্বিতীয় উত্তরটি দিতে সাহস লাগে। ক্রিকেট বিশ্লেষণের বাজারে সেই সাহসটাই সবচেয়ে দুর্লভ।
প্রেক্ষাপট
আধুনিক ক্রিকেট বিশ্লেষণ মূলত একটি পাইপলাইনের কাজ। প্রথম ধাপে ম্যাচ থেকে কাঁচা ডেটা আসে — বল-বাই-বল লগ, ফিল্ডিং প্লেসমেন্ট, রান-রেট, ইকোনমি, স্ট্রাইক-রেট। দ্বিতীয় ধাপে সেই ডেটা পরিষ্কার করা হয়। তৃতীয় ধাপে মডেল দাঁড়ায় — এক্সপেক্টেড রান, এক্সপেক্টেড উইকেট, ওয়ার্কলোড-ঝুঁকি। প্রতিটি ধাপে একটি প্রশ্ন ফিরে ফিরে আসে: এই সংখ্যাটি কোথা থেকে এলো? কতটি নমুনার উপর দাঁড়িয়ে আছে? কোন মাঠ, কোন আবহাওয়া, কোন সময়সূচিতে? এই তিনটি প্রশ্নের উত্তর না থাকলে মডেল যতই চমৎকার হোক, সেটি কেবল একটি সুন্দর মিথ্যা।
২০১৭ সালে বাংলাদেশ প্রিমিয়ার লিগের জন্য আমি হাতে একটি ম্যানুয়াল xG স্প্রেডশিট বানিয়েছিলাম। তখন বুঝিনি, প্রতিটি সংখ্যার পাশে তার উৎস লিখে রাখার এই সাধারণ অভ্যাস একদিন আমার পুরো লেখার পদ্ধতি হয়ে দাঁড়াবে। এখন ফাঁকা পেলোড আমার কাছে কখনো “পূরণ করার আমন্ত্রণ” নয়; এটি একটি সংকেত — উপরের কোনো একটি ধাপ ভেঙে গেছে। আর একটি ভাঙা পাইপলাইনে জোর করে সংখ্যা ঢোকানো মানে পাঠকের সঙ্গে প্রতারণা। ম্যাচ থ্রেড ফরম্যাটে আমি প্রতিটি টুইটকে একটি একক তথ্য-সিদ্ধান্তে সীমাবদ্ধ রাখি, কারণ প্রতিটি দাবির পেছনে একটি যাচাইযোগ্য লেজার থাকা উচিত।
মূল বিশ্লেষণ
২০১৮ সালের রাশিয়া বিশ্বকাপে আমি ক্রোয়েশিয়ার সাতটি ও ফ্রান্সের সাতটি ম্যাচ, প্রতিটি শট মিলিয়ে অডিট করেছিলাম। ক্রোয়েশিয়া গড়ে ১.৪২ xG বানালেও গড়ে ১.২৯ গোল খেয়েছিল; ফ্রান্স গড়ে ২.১০ xG বানিয়ে খেয়েছিল মাত্র ০.৮৬। ওপেন-প্লে xG-তে ক্রোয়েশিয়ার ১.১০ বনাম ফ্রান্সের ২.৪০। ফাইনালের আগে আমি লিখেছিলাম ফ্রান্স জিতবে। ১৫ জুলাই ২০১৮-তে ফ্রান্স ৪-২ গোলে জিতল, আর সেই ব্লগ পড়েছিল ১২,০০০ মানুষ। শেখাটা স্পষ্ট — স্কোরলাইন নয়, প্রক্রিয়া আগে দেখতে হয়। আমি ২০১৮ বিশ্বকাপের প্রতিটি শট অডিট করে দেখেছি কোথায় মডেল ব্যর্থ হয়; একই পদ্ধতি ক্রিকেটের এক্সপেক্টেড রান ও এক্সপেক্টেড উইকেটে সরাসরি প্রযোজ্য।

xG মডেলের ব্যর্থতার ধরনগুলো আসলে কী? প্রথমত, শটের মান নির্ধারণে সহায়তা ও প্রতিরক্ষার চাপ প্রায়ই উপেক্ষিত থাকে। দ্বিতীয়ত, একটি দল বেশি xG বানিয়েও কম গোল করতে পারে — প্রক্রিয়া ভালো, ফল খারাপ। ক্রিকেটের এক্সপেক্টেড রান ও এক্সপেক্টেড উইকেটেও একই সমস্যা ফিরে আসে। একটি ব্যাটসম্যানের শট-মান মাপতে গিয়ে আমরা প্রায়ই বলের লাইন-লেংথ, ফিল্ড-সেটিং ও ম্যাচ-পরিস্থিতি আলাদা করে দেখি না। তাই “এই ব্যাটসম্যানের স্ট্রাইক-রেট বেশি, তাই সে ভালো” — এই সিদ্ধান্তটি অসম্পূর্ণ।
২০২০ সালে, যখন খেলা বন্ধ, আমি বুন্দেসলিগার দর্শক-শূন্য প্রত্যাবর্তন নিয়ে পড়াশোনা করি। ৩০৬টি প্রাক-কোভিড ম্যাচের সঙ্গে তুলনা করি ৯২টি পোস্ট-রিস্টার্ট ম্যাচ। হোম উইন রেট ৪৩.৩% থেকে ৩৩.৩%-এ নামে, আর হোম দলের গড় xG ১.৫৪ থেকে ১.৩১-এ। কিন্তু প্রকাশের আগে আমি নমুনা-আকার, দলীয় মান, সময়সূচি — সব যাচাই করি, তারপর লিখি: ৯২ ম্যাচ দিয়ে হোম-অ্যাডভান্টেজ তত্ত্ব নতুন করে লেখা যায় না। বাংলাদেশের ঘরের মাঠের কথা ভাবলে এই সতর্কতা আরও জরুরি — আমাদের পিচ, গরম, আর্দ্রতা আলাদা, তাই বিদেশি অধ্যয়ন সরাসরি বসানো যায় না। সেই সতর্ক রিপোর্টটি দুটি বাংলাদেশি ক্রীড়া সংবাদমাধ্যম উদ্ধৃত করেছিল।
২০২১ সালে ইউরো কাপে ইতালির প্রেস ও টোকিও অলিম্পিকে স্পেনের পেদ্রিকে আমি ট্র্যাক করি। ইতালির PPDA ছিল ৮.৩, গড় xG ২.১০, আর নকআউট পর্বে তারা প্রতিপক্ষকে দিয়েছিল মাত্র ০.৫৭ xG। পেদ্রি ছয় ম্যাচে ৫৩২টি পাস দিয়েছিলেন ৯২% নির্ভুলতায়, প্রতি ম্যাচে দৌড়েছিলেন ১১.৮ কিমি। আমি তখনই সিদ্ধান্ত নিই — সাত ম্যাচ না দেখা পর্যন্ত কোনো নতুন ট্যাকটিক্যাল মেটা নিয়ে মুখ খুলব না। আমি ২০২১ সালের প্রেস কনফারেন্সগুলো শুনে কেবল উদ্ধৃতি নয়, বিরতিগুলোও গুনেছি। এই ধৈর্য আমার প্রতিক্রিয়া ধীর করেছে, কিন্তু নির্ভরযোগ্যতা বাড়িয়েছে।
এখানেই আসে ব্লকচেইন-ধাঁচের ভাবনা। প্রতিটি ডেটা পয়েন্টের সঙ্গে উৎস, সময় ও পদ্ধতি জুড়ে দিলে তৈরি হয় একটি অপরিবর্তনীয় অডিট-ট্রেইল — যা ব্লকচেইনের মূল প্রতিশ্রুতি। একবার লেখা হলে কেউ চুপিসারে বদলাতে পারে না। ভাবুন, একটি টেস্ট ম্যাচের প্রতিটি ডেলিভারি, প্রতিটি ফিল্ড-প্লেসমেন্ট, প্রতিটি DRS সিদ্ধান্ত — সব টাইমস্ট্যাম্পসহ একটি অপরিবর্তনীয় লেজারে ঢুকে গেল। ম্যাচ শেষ হওয়ার পর কেউ দাবি করতে পারবে না যে “কোনো তথ্য বদলায়নি” — লেজার নিজেই তার সাক্ষী।
তবে আমার দ্বিধাটুকু স্পষ্ট। ব্লকচেইন ডেটার সততা রক্ষা করতে পারে, ডেটার সঠিকতা নয়। যদি কেউ ভুল ডেটা লেজারে লিখে দেয়, ব্লকচেইন সেটিকে চিরকালের ভুল বানিয়ে দেবে। অপরিবর্তনীয়তা সত্যের গ্যারান্টি নয়; এটি কেবল পরিবর্তন-প্রমাণ। আর ঠিক এখানেই নমুনা-আকারের ধৈর্য অপরিহার্য হয়ে ওঠে।
আরেকটি স্তর আছে যাকে আমরা প্রায়ই এড়িয়ে যাই — তরুণ খেলোয়াড়ের উৎস। স্যাটেলাইট-ক্লাব ব্যবস্থায় বড় দলগুলো হোমগ্রাউন নিয়ম ফাঁকি দিয়ে ছোট লিগের প্রতিভাকে নিজের সম্পত্তি বানায়। একটি তরুণ খেলোয়াড় তখন আর নিজের প্রতিভার গল্প নয়, হয়ে ওঠে একটি “স্যাটেলাইট অ্যাসেট” — যার মূল্য মাপা হয় ভবিষ্যৎ বিক্রির সম্ভাবনায়, তার বর্তমান খেলার মানে নয়। এই বাস্তবতা ডেটার সততার প্রশ্নকে আরও জরুরি করে তোলে।
চোটের ক্ষেত্রে সততা আরও দুষ্প্রাপ্য। মেডিক্যাল গোপনীয়তার নামে ক্লাবগুলো কেবল সেই চোটই প্রকাশ করে, যা তাদের স্বার্থের অনুকূল। ফলে একটি ফাস্ট বোলারের ওয়ার্কলোড-ডেটা দেখে আমরা তার প্রকৃত শারীরিক অবস্থা সম্পর্কে প্রায় অন্ধ। ডেটার সততা মানে কেবল সংখ্যার সততা নয়; এর মধ্যে লুকানো তথ্যের স্বীকৃতিও আছে।
কাউন্টার-ইনটুইটিভ কোণ
সবাই বলে “ডেটা সব বলে দেয়”। আমার অভিজ্ঞতা ভিন্ন। ডেটা কোনো কথা বলে না; আমরা তাকে কথা বলাই। একটি ওয়ার্কলোড-ড্যাশবোর্ড যদি বলে একজন পেসার তিন সপ্তাহে গড়ে ৪২ ওভার বলেছে, সেটি সত্য। কিন্তু সেই ৪২ ওভারের প্রতিটি বল কোন মাঠে, কোন তাপমাত্রায়, কতটা বিশ্রামের পর — এসব না জানলে ড্যাশবোর্ডের সংখ্যা কেবল আত্মবিশ্বাস, নিরাপত্তা নয়।
আরেকটি ফাঁদ হলো “ব্ল্যাক-বক্স মডেল ওয়ার্শিপ”। বাজারে অনেক দামি টুল আছে, যারা একটি রেটিং দেয়, কিন্তু তার হিসাব গোপন রাখে। বাংলাদেশের ক্রিকেট বাজারে যেখানে বাজেট সীমিত, সেখানে এমন একটি টুলে বিনিয়োগ করা মানে নিজের বোঝার ক্ষমতা হারানো। একটি মডেল যত দামি, সেটি তত সত্য — এই ধারণাটি ভুল। আমি বরং কম দামের, কিন্তু স্বচ্ছ পাইপলাইন বেছে নিই — যেখানে প্রতিটি সংখ্যার উৎস আমি নিজে যাচাই করতে পারি।
তৃতীয় ফাঁদটি কৌশলগত নয়, নৈতিক। যখন ডেটা না আসে, তখন পূরণ করার চাপ আসে — প্রকাশক চায় কনটেন্ট, পাঠক চায় গল্প, আর ফাঁকা ঘরগুলো তাকিয়ে থাকে। এই চাপে অনুমান ঢোকানোই সবচেয়ে বড় পরাজয়। আমি ট্রান্সফার মার্কেট প্রশাসক হিসেবে দেখেছি, একটি ফি কখনো কেবল একটি সংখ্যা নয় — তার পেছনে বেতন, চুক্তির মেয়াদ, বোনাস, ভবিষ্যৎ ঝুঁকি থাকে। আমি ট্রান্সফার লেজার খুলে দেখেছি, একটি ফি কখনো কেবল একটি সংখ্যা ছিল না। যেখানে সংখ্যার পেছনের গল্প অজানা, সেখানে সংখ্যাটি অসম্পূর্ণ।
টেকঅ্যাওয়ে
আগামী মৌসুমে আমি একটি সংকেত বিশেষভাবে অনুসরণ করব — বাড়তে থাকা ফাস্ট-বোলিং ওয়ার্কলোডের সঙ্গে চোটের সম্পর্ক। ক্যালেন্ডার আরও ভিড়বে, দল বদলাবে আরও ঘন ঘন, আর ডেটার চাপ বাড়বে। প্রশ্নটি হলো: আমরা কি ব্লকচেইন-ধাঁচের স্বচ্ছ লেজার ব্যবহার করব সত্য খুঁজতে, নাকি ফাঁকা ঘরগুলো অনুমান দিয়ে ভরে দেব সুন্দর গল্প বানাতে? প্রতিটি ফাঁকা ঘরের সামনে আপনিও একদিন দাঁড়াবেন। তখন মনে রাখবেন — সৎ “আমি জানি না” সবসময় আত্মবিশ্বাসী মিথ্যার চেয়ে মূল্যবান।

