AI model damıtma küçük modeli hızlandırır; kopyalama çizgisi veride başlar

AI model damıtma, büyük bir öğretmen modelin karar örüntülerini daha küçük bir öğrenci modele aktaran eğitim yöntemidir. Küçük öğrenci hedef donanımda daha hızlı ve daha az kaynakla çalışabilir; kazanç damıtma adımından değil, bu adımla eğitilen kompakt mimarinin dağıtılmasından gelir.
Aynı teknik çerçeve her veri kaynağını meşru kılmaz. Kendi modelinizden veya kullanımına yetkili olduğunuz bir öğretmenden eğitim sinyali almak sıkıştırma amacı taşıyabilir; dış bir hizmetin cevaplarını yeniden üretim amacıyla toplamak ise veri kökeni, erişim izni ve sözleşme bakımından model çıkarımı alanına girer.
Öğretmen–öğrenci düzeni nasıl çalışır?

Klasik denetimli eğitimde öğrenciye çoğunlukla tek bir kesin etiket gösterilir: “Bu görüntü kedidir.” Damıtmada öğretmen aynı örnek için kedi, tilki ve köpek sınıflarına farklı olasılıklar verir. Öğrenci böylece doğru sınıfın yanında öğretmenin yanlış seçenekler arasında kurduğu yakınlıkları da öğrenir.
Hinton, Vinyals ve Dean’in çalışması, büyük bir modelin veya model topluluğunun bilgisini dağıtımı daha kolay küçük bir modele aktarmak için yumuşatılmış hedeflerin kullanılmasını açıklar. En sade düzende öğretmen sabit tutulur; öğrencinin ağırlıkları, öğretmenin dağılımı ile öğrencinin dağılımı arasındaki farkı azaltacak biçimde güncellenir. Gerçek etiketler varsa bunlara dayanan kayıp da eğitime eklenebilir.
Öğretmenin ağırlıkları küçültülerek öğrenciye yapıştırılmaz. Öğrenci kendi parametrelerini öğrenir ve öğretmenle aynı mimariye sahip olmak zorunda değildir. Aktarılan bilgi; seçilen örneklerdeki çıktı olasılıkları, logitler, ara temsiller veya bunlar arasındaki ilişkiler olabilir.
Logit ve sıcaklık neyi görünür kılar?

Logit, bir modelin seçeneklere olasılık atamadan önce ürettiği ham skordur. Koşullu bir örnekte öğretmenin üç sınıf için logitleri 4, 2 ve 0 olsun. Sıcaklık T=1 iken softmax işlemi yaklaşık yüzde 86,7, yüzde 11,7 ve yüzde 1,6 olasılık üretir.
Sıcaklık T=2 yapıldığında logitler softmax öncesinde ikiye bölünür; dağılım yaklaşık yüzde 66,5, yüzde 24,5 ve yüzde 9,0 olur. İlk seçenek yine öndedir, ancak öğretmenin diğer iki seçenek arasında kurduğu göreli ayrım öğrenci için daha güçlü bir eğitim sinyaline dönüşür. Bunlar yayımlanmış bir test sonucu değil, formülün etkisini gösteren koşullu hesaplamalardır.
Eğitim kaybı genellikle öğretmenin yumuşak hedefleri ile gerçek etiketlere dayanan sert hedefleri dengeler. Aynı yüksek sıcaklık öğretmen ve öğrenci dağılımları karşılaştırılırken kullanılır; eğitim tamamlandıktan sonra normal çıkarım sıcaklığı 1’e döner. Her görev ve öğrenci kapasitesi için geçerli tek bir sıcaklık ya da kayıp ağırlığı yoktur.
Öğrenci gerçekte neyi devralır?
Yumuşak etiketler açıklamanın yalnızca bir parçasıdır. Damıtmanın eğitim dinamikleri üzerine çalışma, öğretmen bilgisini üç düzeyde inceler: etiket yumuşatmaya benzeyen düzenlileştirme etkisi, sınıflar arasındaki ilişkiler ve örneğin zorluğuna bağlı gradyan ölçekleme. Bu çerçevede aynı doğru etikete sahip iki örnek, öğrenciye aynı eğitim sinyalini vermek zorunda değildir.
Ortaya çıkan öğrenci, öğretmenin eksiksiz kopyası değildir. Kapasitesi daha sınırlıdır ve yalnızca aktarım kümesinin açığa çıkardığı davranışları görebilir. Nadir girdiler, alan dışı bilgi, kalibrasyon veya güvenlik davranışı örneklerde yeterince temsil edilmiyorsa bunların korunacağı varsayılamaz.
Dört benzer yaklaşım nerede ayrılır?
- Sıkıştırma amaçlı bilgi damıtma: Kullanımına yetkili olunan öğretmenin logitleri, ara temsilleri veya cevapları daha küçük bir öğrenciye aktarılır. Amaç genellikle kabul edilebilir görev kalitesiyle gecikmeyi, bellek ihtiyacını veya çıkarım maliyetini azaltmaktır.
- Sentetik veri üretimi: Bir model yeni soru-cevaplar, açıklamalar veya etiketli örnekler üretir. Bu veri başka bir modeli eğitebilir; ancak üretici modelin daha büyük olması veya klasik damıtma kaybının kullanılması gerekmez.
- Self-distillation: Aynı model ailesinin daha önce eğitilmiş bir örneği, önceki bir kontrol noktası ya da modelin kendi tahminleri öğretmen rolü üstlenir. Hedef her zaman küçültme değildir; aynı kapasitedeki öğrencinin genellemesini geliştirmek de amaçlanabilir.
- Model çıkarımı: Kara kutu niteliğindeki harici bir model sorgulanır ve dönen tahminler, onun işlevini taklit edecek başka bir modeli eğitmekte kullanılır. Burada ayırıcı unsur yalnızca kayıp fonksiyonu değil, hedef modelle ilişki, sorguların amacı ve çıktının kullanım yetkisidir.
Dolayısıyla “çıktılar eğitimde kullanıldı” bilgisi tek başına yeterli değildir. Öğretmenin sahibi, model ve veri lisansları, sorgulama yöntemi, çıktının alınma amacı ve türetilen öğrencinin kullanım biçimi birlikte değerlendirilmelidir.
Kopyalama çizgisi neden veride başlar?

Bir API’nin cevap vermesi, bu cevapların her amaçla yeniden kullanılabileceği anlamına gelmez. Örneğin iş müşterileri ve geliştiriciler için geçerli OpenAI Services Agreement, tanımlanan istisnalar dışında çıktının OpenAI ürün ve hizmetleriyle rekabet eden modeller geliştirmekte kullanılmasını ve hizmetten izin verilmeyen biçimde veri çıkarılmasını kısıtlar. Bu hüküm evrensel bir hukuk kuralı değil, belirli bir sağlayıcı ile belirli müşteri grupları arasındaki sözleşmenin örneğidir.
Bu nedenle ilk ayrım eğitim sinyalinin kökeninde yapılır: Kim üretti, hangi erişim biçimiyle alındı ve hangi yeniden kullanım izni verildi? Kendi modelinizin kendi veriniz üzerindeki logitleri ile üçüncü tarafın kapalı hizmetinden otomatik sorgularla toplanan cevaplar teknik olarak benzer hedeflere dönüştürülebilir, fakat yetki bakımından eşdeğer değildir.
Veri kökeni kaydı tek başına hukuki onay da sayılmaz. Model lisansı ve hizmet şartlarının yanında kişisel verilerin korunması, telif, ticari sır ve sektörel yükümlülükler ayrıca değerlendirilmelidir. “Damıtma” adı, bu incelemelerin yerine geçmez.
Hız kazancı hangi sınırlar içinde geçerlidir?
Damıtmanın sonucu yalnızca doğruluk skoruyla ölçülmemelidir. Öğrencinin hedef donanımdaki uçtan uca gecikmesi, bellek tüketimi, çıktı başına maliyeti ve görev kalitesi birlikte karşılaştırılmalıdır. Daha az parametre çoğu durumda avantaj sağlasa da çalışma zamanı, niceleme, giriş uzunluğu, bellek erişimi ve donanım uyumu gerçek hızlanmayı değiştirebilir.
Kalite değerlendirmesi de öğretmenin eğitim örneklerindeki cevaplarını taklit etmekle sınırlı kalmamalıdır. Ayrı bir doğrulama kümesi; nadir sınıfları, alan dışı girdileri, kalibrasyonu ve gerekli güvenlik davranışlarını kapsamalıdır. Dağıtımdan önce uygun modeli seçerken lisans, görev uyumu ve çalıştırma gereksinimlerinin ayrıca incelenmesi gerekir.
Sonuçta iki soru birbirinden ayrı yanıtlanır: Küçük öğrenci hedef ortamda yeterince hızlı ve başarılı mı; öğretim sinyalini bu amaçla kullanma yetkisi var mı? Birincisi ölçümle, ikincisi veri kökeni ile geçerli lisans ve sözleşmelerle belirlenir.
Ayrıca okuyun:
Bültenimize abone olun
En son Web3, yapay zekâ ve kripto haberleri doğrudan gelen kutunuza gelsin.