AI model distillation সবসময় চুরি নয়—অনুমতির সীমা বুঝুন

AI model distillation হলো বেশি সক্ষম teacher model-এর output বা শেখানো সংকেত ব্যবহার করে ছোট student model-কে অনুরূপ কাজ শেখানোর পদ্ধতি। এটি model ছোট করা ও inference-এর খরচ কমানোর স্বীকৃত কৌশল; তাই distillation নিজে চুরি নয়।
সীমাটি নির্ভর করে output পাওয়ার পথ, সেটি training-এ ব্যবহারের অনুমতি, licence বা terms-এর বাধ্যবাধকতা এবং input-output-এ থাকা মানুষের বা প্রতিষ্ঠানের তথ্যের ওপর। অনুমোদিত teacher–student training বৈধ engineering workflow হতে পারে; কিন্তু access control ফাঁকি দিয়ে proprietary capability সংগ্রহ করলে একই কৌশল অননুমোদিত extraction-এর অংশ হয়ে ওঠে।
Teacher–student training কীভাবে কাজ করে

সাধারণ supervised learning-এ student model একটি input-এর সঙ্গে শুধু চূড়ান্ত label পেতে পারে। Distillation-এ teacher প্রতিটি সম্ভাব্য class-এর জন্য score বা probability দেয়। সঠিক উত্তরের পাশাপাশি কোন বিকল্পগুলো কাছাকাছি—এই অতিরিক্ত সম্পর্কও student শিখতে পারে।
Geoffrey Hinton, Oriol Vinyals ও Jeff Dean-এর knowledge-distillation গবেষণাপত্র ensemble-এর শেখা response distribution একটি সহজে deploy করা যায় এমন model-এ স্থানান্তরের পদ্ধতি ব্যাখ্যা করে। Generative AI-তে একই নীতির একটি রূপ হলো teacher-এর তৈরি উত্তর, code বা task-specific উদাহরণ দিয়ে student-কে fine-tune করা।
একটি শর্তসাপেক্ষ উদাহরণে, কোনো প্রতিষ্ঠান নিজের teacher model দিয়ে অনুমোদিত নথি থেকে প্রশ্ন–উত্তর তৈরি করে ছোট একটি model প্রশিক্ষণ করতে পারে। এখানে student-কে teacher-এর architecture বা weights হুবহু নকল করতে হয় না; লক্ষ্য হলো নির্বাচিত কাজের জন্য teacher-এর output থেকে শেখা।
কখন এটি স্বাভাবিক optimization
সবচেয়ে পরিষ্কার পরিস্থিতি হলো একই প্রতিষ্ঠান teacher ও student উভয়টি নিয়ন্ত্রণ করে, অথবা তৃতীয় পক্ষের licence স্পষ্টভাবে output দিয়ে training বা synthetic data তৈরির অনুমতি দেয়। কোনো model-এর weights পাওয়া গেলেও তার licence আলাদাভাবে পড়তে হয়: open-weight হওয়া সব ধরনের commercial use, redistribution বা derivative training-এর স্বয়ংক্রিয় অনুমতি নয়।
Access এবং reuse দুটি পৃথক অধিকার। API subscription output দেখার সুযোগ দিতে পারে, অথচ সংশ্লিষ্ট terms সেই output দিয়ে প্রতিযোগী model প্রশিক্ষণ নিষিদ্ধ করতে পারে। বিপরীতে, training অনুমোদিত হলে document করা account, অনুমোদিত endpoint এবং ঘোষিত উদ্দেশ্যে output সংগ্রহ স্বাভাবিক workflow-এর অংশ হতে পারে।
Attribution-ও licence-নির্ভর বাধ্যবাধকতা। creator-এর নাম, licence notice, provenance বা পরিবর্তনের বিবরণ রাখার শর্ত থাকলে সেগুলো বাদ দেওয়া non-compliance; তবে attribution না থাকার ঘটনাকে একাই capability extraction বলা যায় না। Contract, copyright ও trade-secret প্রশ্ন নির্দিষ্ট jurisdiction ও ঘটনার প্রমাণের ওপর নির্ভর করে।
সীমারেখা নির্ধারণ করে চারটি প্রশ্ন

Access: output কি অনুমোদিত account, API key, licence ও অঞ্চলের নিয়ম মেনে পাওয়া হয়েছে? ভুয়া পরিচয়, চুরি করা credentials, proxy বা account rotation দিয়ে নিয়ন্ত্রণ এড়ানো হলে আপত্তির শুরু training algorithm নয়, সংগ্রহের পথ থেকে।
Consent: provider কি output-কে অন্য model-এর training data হিসেবে ব্যবহারের অনুমতি দিয়েছে? কোনো ব্যবহারকারীর prompt বা conversation পুনর্ব্যবহার করা হলে সেই ব্যক্তি বা প্রতিষ্ঠানের disclosure ও consent কি নতুন উদ্দেশ্যটি অন্তর্ভুক্ত করে? একটি service ব্যবহারে সম্মতি গোপনে কথোপকথন সংরক্ষণ ও বিক্রির সম্মতির সমান নয়।
Attribution ও terms: licence notice, provenance, redistribution restriction এবং model-training clause মানা হয়েছে কি? শর্ত ভাঙা contractual সমস্যা তৈরি করতে পারে, যদিও প্রতিটি breach-কে চুরি বা বেআইনি extraction বলা যায় কি না তা প্রযোজ্য আইন ও প্রমাণ ছাড়া স্থির করা যায় না।
Data exposure: সংগ্রহ করা prompt বা response-এ নাম, যোগাযোগের তথ্য, credentials, client file কিংবা গোপন company data আছে কি? Anthropic-এর সেপ্টেম্বর ২০২৬ threat-intelligence report illicit distillation-কে অনুমতি ছাড়া industrial-scale ও covert capability extraction হিসেবে সংজ্ঞায়িত করেছে; প্রতিষ্ঠানটি proxy service, ভুয়া account, চুরি করা API key এবং ব্যবহারকারীর অজ্ঞাতে সংরক্ষিত exchange ব্যবহারের অভিযোগও বর্ণনা করেছে। এগুলো Anthropic-এর তদন্তলব্ধ দাবি, আদালতে প্রতিষ্ঠিত সিদ্ধান্ত নয়।
Training শুরুর আগে সিদ্ধান্ত-গাছ

- Teacher model বা API কার, কোন licence ও terms প্রযোজ্য এবং output দিয়ে training স্পষ্টভাবে অনুমোদিত কি না লিখে রাখুন। নিজের model না হলে শুধু access পাওয়াকে training permission ধরে নেবেন না।
- Output সংগ্রহের পথ চিহ্নিত করুন। অনুমোদিত account ও endpoint-এর বদলে proxy, ধার করা credential বা বহু account দিয়ে restriction এড়াতে হলে workflow থামান।
- Input-এর provenance পরীক্ষা করুন। user conversation, client document বা production log থাকলে disclosure ও reuse consent training-এর উদ্দেশ্যটি অন্তর্ভুক্ত করে কি না দেখুন; অপ্রয়োজনীয় personal data ও secret বাদ দিন।
- Model training, automated extraction, competitive development, redistribution, retention ও attribution নিয়ে পৃথক শর্ত খুঁজুন। অস্পষ্টতা থাকলে লিখিত permission বা provider clarification ছাড়া অনুমাননির্ভরভাবে এগোবেন না।
- Model version, collection method, permission-এর ভিত্তি, filtering ও retention period নথিবদ্ধ করুন। এতে কোন output কোন শর্তে সংগ্রহ হয়েছিল এবং পরে কোন dataset-এ গেছে তা অনুসরণ করা সম্ভব হয়।
কোনো ধাপে উত্তর “না” বা “অজানা” হওয়া নিজে অপরাধের প্রমাণ নয়। তবে সেটি training চালুর আগে legal, privacy বা security review প্রয়োজন হওয়ার স্পষ্ট সংকেত।
প্রচলিত কৌশল আর অভিযুক্ত conduct এক নয়
সাম্প্রতিক যুক্তরাষ্ট্র–চীন বিরোধ এই পার্থক্যটি স্পষ্ট করেছে। Associated Press-এর প্রতিবেদন অনুযায়ী, যুক্তরাষ্ট্রের FBI, NSA ও CISA এক যৌথ advisory-তে একাধিক চীনা AI developer-এর বিরুদ্ধে বহু পথে unauthorized access নিয়ে terms ভেঙে capability extraction-এর অভিযোগ করেছে; চীনের বাণিজ্য মন্ত্রণালয় অভিযোগ প্রত্যাখ্যান করে distillation-কে বিশ্বজুড়ে প্রচলিত practice বলেছে।
দুটি বক্তব্য একই প্রশ্নের উত্তর নয়। Distillation প্রচলিত technique কি না একটি পদ্ধতিগত প্রশ্ন; নির্দিষ্ট campaign-এ প্রতারণামূলক access, contractual breach বা data misuse ঘটেছে কি না আলাদা প্রমাণনির্ভর প্রশ্ন। অভিযোগ থাকা মানেই আদালতে দায় প্রমাণিত হওয়া নয়, আবার technique বৈধ হওয়া প্রতিটি সংগ্রহপদ্ধতিকে অনুমোদিতও করে না।
সুতরাং student model teacher-এর মতো উত্তর দেয় কি না—এটি একমাত্র পরীক্ষা নয়। Output কীভাবে পাওয়া ও পুনর্ব্যবহার করা হয়েছে, প্রয়োজনীয় attribution রাখা হয়েছে কি না এবং অন্যের confidential data training pipeline-এ ঢুকেছে কি না—এই চার দিক মিলিয়েই স্বীকৃত optimization ও অননুমোদিত extraction-এর সীমা বোঝা যায়।
আরও পড়ুন:
আমাদের নিউজলেটার নিন
সর্বশেষ Web3, AI ও ক্রিপ্টো সংবাদ সরাসরি আপনার ইনবক্সে পান।