Hugging Face tanpa bingung: Models, Datasets, dan Spaces punya fungsi berbeda

Hugging Face Hub adalah platform untuk menemukan, membagikan, dan mengelola model, dataset, serta aplikasi AI. Cara menggunakannya bergantung pada hasil yang dicari: buka Models untuk memperoleh model, Datasets untuk menjelajah data, dan Spaces untuk mencoba aplikasi interaktif.
Sebelum mengunduh atau menjalankan sesuatu, periksa card, lisensi, pembuat, berkas, dan riwayat repositorinya. Pratinjau atau widget berguna untuk penyaringan awal, tetapi tidak membuktikan bahwa aset tersebut akurat, aman, legal untuk tujuan Anda, atau siap dipakai dalam produksi.
Pilih repositori berdasarkan hasil yang dibutuhkan

Dokumentasi Hugging Face Hub menjelaskan bahwa Models, Datasets, dan Spaces memiliki fungsi berbeda di dalam repositori berbasis Git: model menyediakan aset pembelajaran mesin, dataset memuat data dari berbagai domain dan modalitas, sedangkan Spaces menjalankan aplikasi interaktif di peramban.
- Models: pilih ketika Anda membutuhkan bobot dan konfigurasi model untuk inferensi, evaluasi, atau fine-tuning. Repositorinya dapat menyertakan tokenizer, contoh pemakaian, metadata tugas, hasil evaluasi, dan model card.
- Datasets: pilih ketika bahan yang dibutuhkan adalah data untuk pelatihan, evaluasi, eksplorasi, atau analisis. Dataset dapat dibagi ke dalam konfigurasi dan split, misalnya train, validation, dan test.
- Spaces: pilih ketika tujuan awalnya mencoba alur aplikasi melalui antarmuka interaktif. Space dapat memakai model atau dataset dari repositori lain, tetapi aplikasi tersebut bukan pengganti aset dasarnya.
Gunakan pertanyaan sederhana untuk menentukan pintu masuk. Jika hasil yang dicari adalah prediksi atau representasi, cari model; jika membutuhkan baris, gambar, audio, atau berkas data, cari dataset; jika ingin memahami pengalaman penggunaan, mulai dari Space. Untuk proyek sendiri, tetap telusuri repositori model dan dataset yang dipakai aplikasi tersebut.
Nilai model dari card, batasan, dan lisensinya

Setelah menyaring hasil berdasarkan tugas, bahasa, pustaka, dan lisensi, baca model card. Card yang memadai seharusnya menerangkan tujuan penggunaan, batasan, bias, data pelatihan, cara memakai model, dan hasil evaluasinya. Bagian yang kosong bukan bukti bahwa tidak ada masalah; itu berarti informasi yang tersedia belum cukup untuk menilai bagian tersebut.
Pastikan hasil evaluasi benar-benar relevan dengan kebutuhan Anda. Skor pada dataset, bahasa, tugas, atau konfigurasi tertentu tidak otomatis menggambarkan kinerja pada data berbahasa Indonesia. Periksa juga apakah repositori berisi model lengkap, adapter, hasil fine-tuning, atau versi terkuantisasi karena cara pemuatan dan kebutuhan komputasinya dapat berbeda.
Lisensi harus diperiksa terpisah dari mutu teknis. Baca izin penggunaan, modifikasi, distribusi ulang, penggunaan komersial, dan kewajiban atribusi yang berlaku. Keberadaan tombol unduh tidak dengan sendirinya memberikan hak untuk memakai model bagi setiap tujuan; jika metadata menunjuk ke lisensi khusus, baca teks lisensi yang dirujuk.
Widget inferensi dapat dipakai dengan masukan yang tidak sensitif untuk melihat bentuk input dan output. Perlakukan hasilnya sebagai pemeriksaan fungsi dasar, bukan evaluasi menyeluruh. Beberapa prompt tidak cukup untuk menyimpulkan akurasi, bias, latensi, kebutuhan komputasi, atau kestabilan model.
Periksa isi dataset sebelum memuat semuanya
Mulailah dari dataset card dan pratinjau data. Periksa sumber, metode pengumpulan, konfigurasi, split, nama kolom, tipe data, contoh baris, proses pembersihan, batasan, dan lisensi. Untuk data tentang manusia, cari keterangan mengenai persetujuan, privasi, materi sensitif, serta penggunaan yang dimaksud.
Tutorial resmi pustaka Datasets mencakup pemuatan konfigurasi dan split, pemeriksaan isi, praproses, serta pembagian dataset ke Hub. Tutorial itu ditujukan bagi pemula, tetapi tetap mengasumsikan pengetahuan dasar Python dan kerangka pembelajaran mesin seperti PyTorch atau TensorFlow.
Menjelajah card dan contoh data melalui peramban tidak memerlukan alur pemrograman lengkap. Ketika mulai memakai dataset melalui kode, muat konfigurasi dan split yang benar, lalu periksa skema serta beberapa contoh sebelum melakukan pemrosesan besar. Untuk koleksi yang tidak praktis disalin seluruhnya, streaming memungkinkan data dibaca secara bertahap.
Streaming mengurangi kebutuhan penyimpanan lokal, bukan risiko mutu atau perizinan. Distribusi label, bahasa, duplikasi, data rusak, ketimpangan kelompok, dan kesesuaian lisensi tetap perlu dinilai. Catat ID repositori, konfigurasi, split, dan revisi jika eksperimen harus dapat diulang.
Anggap Spaces sebagai aplikasi demonstrasi

Spaces berguna untuk memahami input, output, dan alur sebuah aplikasi tanpa lebih dahulu menyiapkan lingkungan lokal. Anda dapat menguji contoh yang tidak rahasia dan melihat apakah pola interaksinya sesuai dengan kebutuhan awal.
Namun, keluaran Space dapat berasal dari keseluruhan aplikasi, bukan dari satu model saja. Kode aplikasi mungkin menambahkan prompt, validasi input, praproses, pascaproses, atau model lain. Karena itu, buka repositorinya dan identifikasi aset yang digunakan sebelum mengaitkan hasil demonstrasi dengan kemampuan model tertentu.
Jangan memasukkan data pribadi, dokumen rahasia, token, atau materi organisasi ke Space publik tanpa memahami siapa pengelolanya dan bagaimana data diproses. Space juga dapat berubah ketika repositorinya diperbarui atau berhenti tersedia. Untuk keputusan penting, uji model dalam lingkungan dan dengan data evaluasi yang Anda kendalikan.
Gated repository dan pemindaian tetap memerlukan kehati-hatian
Status gated berarti akses ke berkas dibatasi melalui permintaan, bukan bahwa model atau dataset telah dinyatakan aman maupun cocok untuk semua penggunaan. Sebelum menyetujui formulir akses, baca informasi yang akan dibagikan, syarat penggunaan, lisensi, dan kebijakan yang dirujuk. Setelah memperoleh akses, lakukan pemeriksaan repositori yang sama seperti pada aset publik.
Lihat daftar berkas sebelum mengunduh dan jangan langsung menjalankan skrip atau dependensi yang tidak dikenal. Panduan Pickle Scanning Hugging Face memperingatkan bahwa pemuatan berkas pickle dapat dimanfaatkan untuk eksekusi kode arbitrer serta menyarankan penggunaan aset dari pengguna atau organisasi tepercaya.
Pemindaian platform membantu menandai risiko yang dikenali, tetapi bukan pengganti peninjauan kode dan dependensi. Untuk percobaan pertama, gunakan lingkungan terisolasi, masukan nonrahasia, token dengan izin minimum, dan revisi repositori yang dipatok. Urutan yang aman adalah memilih jenis repositori, membaca card dan lisensi, mencoba pratinjau, lalu meninjau berkas sebelum mengunduh atau menjalankannya.
Berlangganan buletin kami
Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.