AI tool pilot-এ ভালো result দিলেই production-এ প্রতিদিন একই quality থাকবে—এমন নিশ্চয়তা নেই। Input বদলায়, source পুরোনো হয়, model update হয়, user নতুনভাবে prompt লেখেন এবং connected tool-এর permission-ও বদলাতে পারে। ফলে ভুল answer, unsupported claim, incomplete summary বা অনুপযুক্ত action ধীরে ধীরে workflow-এ ঢুকে যায়। Monitoring-এর কাজ প্রতিটি output সন্দেহ করা নয়; কোন ভুল business-এর জন্য গুরুত্বপূর্ণ, সেটি দ্রুত ধরা এবং মানুষকে ঠিক evidence-সহ decision নিতে সাহায্য করা।

প্রথমে acceptable output লিখে নিন

“ভালো answer” মাপা যায় না। Use case অনুযায়ী required field, allowed source, tone, response time, prohibited content এবং human approval point লিখুন। Customer reply হলে accuracy, politeness ও policy compliance লাগবে; data extraction হলে field completeness ও format match জরুরি। একই rubric-এ পাঁচ থেকে দশটি approved example রাখুন। এগুলো golden sample, কিন্তু স্থায়ী সত্য নয়—policy বা product বদলালে example-ও update করতে হবে। Baseline ছাড়া dashboard-এর সংখ্যা শুধু সাজসজ্জা হয়ে যায়।

সব output নয়, risk অনুযায়ী sample নিন

High-risk action যেমন refund suggestion, account change, medical বা financial claim, personal data handling এবং public publish—এসবের review rate বেশি রাখুন। সাধারণ classification বা draft summary থেকে random sample নিন। শুধু successful output দেখবেন না; timeout, empty response, user correction এবং cancelled action-ও sample-এ রাখুন। নতুন model, prompt বা integration release-এর প্রথম কয়েক দিন review বাড়ান। Low-volume workflow হলে সব output review করাই সহজ হতে পারে; high-volume হলে stratified sampling বেশি বাস্তবসম্মত।

চার ধরনের signal আলাদা করুন

Technical signal-এ latency, timeout, malformed JSON ও tool error থাকবে। Content signal-এ missing source, contradictory statement, unsafe language বা wrong language ধরা হবে। Business signal-এ refund loss, reopened ticket, correction time ও complaint দেখুন। Human signal-এ reviewer disagreement, override reason এবং unclear instruction রাখুন। সবকিছুকে একটি “accuracy” শতাংশে মিশিয়ে দিলে cause বোঝা যায় না। Signal অনুযায়ী owner ও response time আলাদা রাখলে alert actionable হয়।

Automatic check-এর সীমা বুঝুন

Schema validation, required keyword, duplicate detection, PII pattern, forbidden phrase এবং source URL presence automation দিয়ে দেখা যায়। কিন্তু context, fairness, nuanced Bengali, humour, brand promise বা policy exception মানুষের review চায়। আরেকটি AI দিয়ে প্রথম AI-এর answer judge করলে speed বাড়ে, কিন্তু সেটিকে independent truth ধরবেন না। Judge prompt, model ও failure sample আলাদা test করুন। Automatic score low হলে block বা queue করা যায়; high score মানেই blind publish নয়।

Alert এমন করুন যাতে team কাজ করতে পারে

প্রতিটি ছোট variation-এ alert দিলে মানুষ notification ignore করতে শুরু করে। Threshold-এর সঙ্গে volume ও duration যোগ করুন—যেমন ৩০ মিনিটে malformed output ৫ শতাংশের বেশি, অথবা high-risk claim একবার দেখা গেলেই urgent alert। Alert-এ workflow, time range, affected sample, recent change, owner এবং safe action দিন। Raw personal data chat channel-এ পাঠাবেন না। Dashboard trend দেখাবে, আর incident alert immediate decision-এর জন্য হবে; দুইয়ের উদ্দেশ্য গুলিয়ে ফেলবেন না।

Human escalation route আগে test করুন

Reviewer কে, backup reviewer কে, রাত বা ছুটির দিনে কী হবে এবং automation কীভাবে pause হবে—launch-এর আগেই লিখুন। Kill switch থাকলেও permission না থাকলে কাজে আসবে না। Queue pause, last known good prompt restore, model rollback এবং manual process-এ ফিরে যাওয়ার rehearsal করুন। Reviewer যেন output-এর সঙ্গে source, original input, relevant policy ও previous action দেখতে পান। Secret, token বা অপ্রয়োজনীয় personal payload log-এ রাখবেন না।

সাপ্তাহিক review checklist

  1. Top error category ও তার business impact দেখুন।
  2. Random এবং high-risk sample দুটোই review করুন।
  3. Recent prompt, model, source ও permission change মিলিয়ে নিন।
  4. False positive alert এবং missed error আলাদা লিখুন।
  5. User correction ও complaint থেকে নতুন test case বানান।
  6. Rollback এবং manual fallback এখনও কাজ করে কি না দেখুন।
  7. Owner, threshold ও next review date update করুন।

Metric থেকে সিদ্ধান্ত নিন

Accuracy বাড়লেও correction time বা complaint বাড়তে পারে। তাই pass rate-এর সঙ্গে reviewer time, escalation rate, user satisfaction, cost per task এবং prevented incident দেখুন। একটি metric improve করতে গিয়ে response অস্বাভাবিক slow হচ্ছে কি না খেয়াল রাখুন। মাসে অন্তত একবার edge case set দিয়ে regression test চালান। Workflow স্থিতিশীল হলেও quarterly permission ও retention audit রাখুন। Monitoring সফল তখনই, যখন signal দেখে নির্দিষ্ট action নেওয়া যায় এবং একই ভুলের পুনরাবৃত্তি কমে।