Quasa
QUASA ऐप का उपयोग करें
आज ही Web3 क्रिप्टो फ्रीलांसिंग के अग्रणी मंच से जुड़ें!
खोलें
क्रिएटर अर्थव्यवस्था

OSSL-v2 में 246 घंटे की फिल्में—AI संगीत में संवाद अब अलग संकेत

|लेखक: QUASA संपादकीय टीम|5 मिनट पढ़ने का समय| 11
OSSL-v2 में 246 घंटे की फिल्में—AI संगीत में संवाद अब अलग संकेत

Haven Kim, Zachary Novack, Julian McAuley और Hao-Wen Dong ने 12 अगस्त 2026 को OSSL-v2 का नया पूर्वप्रकाशन प्रस्तुत किया। arXiv पर प्रकाशित शोध विवरण के अनुसार, सार्वजनिक-डोमेन फिल्मों से बने इस संग्रह में 34,343 वीडियो-संगीत क्लिप और कुल 246.4 घंटे की सामग्री है; संवाद को प्रत्येक समय-बिंदु से जुड़ा अलग कंडीशनिंग संकेत बनाकर वीडियो-से-संगीत मॉडल में परखा गया है।

यह बदलाव केवल संग्रह का आकार बढ़ाने तक सीमित नहीं है। पुराने OSSL में दृश्य और मानव-अंकित मनोदशा की जानकारी प्रमुख थी, जबकि OSSL-v2 में बोलने के समय और ध्वनिक तीव्रता को दृश्य क्रम के साथ मिलाया गया है। प्रकाशित परिणाम कुछ मॉडल और मापों पर सुधार दिखाते हैं, पर संवाद-सचेत व्यवस्था को हर मॉडल के लिए सुनिश्चित लाभ नहीं मानते।

OSSL-v2 में क्या उपलब्ध है

सार्वजनिक-डोमेन फिल्मों से संगीत अंश निकालकर OSSL-v2 के स्व-होस्टेड क्लिप संग्रह में बदलने की प्रक्रिया

संग्रह सार्वजनिक-डोमेन फिल्मों के वीडियो अंशों और उनसे अलग किए गए संगीत को जोड़ी के रूप में रखता है। संगीत निकालने के बाद स्वचालित ध्वनि-घटना पहचान से ऐसे हिस्से चुने गए जिनमें लगातार कम-से-कम 10 सेकंड तक संगीत की संभावना गैर-संगीत ध्वनियों से अधिक थी। अंतिम क्लिप की औसत अवधि 28.6 सेकंड है।

संग्रह को केवल YouTube पहचान-सूचियों के रूप में बाँटने के बजाय स्वयं होस्ट किया गया है। इसका उद्देश्य उस समस्या को कम करना है जिसमें हटाए गए या निजी किए गए वीडियो के कारण अलग-अलग प्रयोगशालाओं को प्रशिक्षण और परीक्षण के लिए समान सामग्री नहीं मिलती।

Hugging Face की OSSL-v2 कार्ड 31,011 प्रशिक्षण क्लिप, 3,332 परीक्षण क्लिप, कुल 34,343 पंक्तियाँ और CC BY 4.0 लाइसेंस टैग दिखाती है। कार्ड पर कुल 1,812 फिल्मों की मेटाडेटा प्रविष्टियाँ हैं, जबकि शोधपत्र संग्रह-निर्माण का स्रोत 1,886 सार्वजनिक-डोमेन फिल्में बताता है; उपलब्ध दस्तावेज इस अंतर का कारण स्पष्ट नहीं करते।

सार्वजनिक-डोमेन स्रोत अधिकार-संबंधी जोखिम को कम कर सकते हैं, लेकिन सभी उपयोगों के लिए स्वतः अनुमति नहीं बनाते। संग्रह का CC BY 4.0 टैग, स्रोत फिल्मों की सार्वजनिक-डोमेन स्थिति, शोध कोड और किसी मॉडल से बनी नई ध्वनि अलग-अलग अधिकार-परतें हैं। भारत में व्यावसायिक फिल्म या संगीत परियोजना के लिए केवल संग्रह का लाइसेंस टैग पूरे कार्यप्रवाह की कानूनी मंजूरी नहीं माना जा सकता।

मूल OSSL से पैमाना और संकेत दोनों बदले

36.5 घंटे के मूल OSSL और 246.4 घंटे के संवाद-सचेत OSSL-v2 संग्रह की तुलना

2025 के मूल OSSL शोधपत्र में लगभग 36.5 घंटे की सार्वजनिक-डोमेन फिल्म क्लिप, उच्च-गुणवत्ता वाले साउंडट्रैक और मानव-अंकित मनोदशा सूचना थी। उस प्रयोग में वीडियो कंडीशनिंग के लिए MusicGen-Medium में एक अनुकूलक जोड़ा गया था।

246.4 घंटे वाला नया संग्रह अवधि में मूल OSSL से लगभग 6.75 गुना बड़ा है। यह गणना दोनों शोधपत्रों में दी गई अवधियों पर आधारित है, लेकिन दोनों संस्करणों का अंतर केवल मात्रा का नहीं है: पहले संग्रह की मनोदशा सूचना पूरे दृश्य के भाव को व्यक्त करती थी, जबकि नया संवाद संकेत क्लिप के भीतर समय के साथ बदलता है।

इससे मॉडल को यह जानने का अवसर मिलता है कि कोई पात्र कब बोल रहा है और अलग किए गए संवाद में ऊर्जा या तीव्रता कैसे बदल रही है। संवाद की प्रति-फ्रेम ध्वनिक विशेषताएँ उसी समय के दृश्य निरूपण को प्रभावित करती हैं, इसलिए उसे पूरे क्लिप पर लागू एक स्थिर विवरण की तरह नहीं पढ़ा जाता।

संवाद-सचेत प्रयोग का परिणाम एकसमान नहीं रहा

प्रयोग VidMuse, GVMGen और Diff-V2M पर किए गए। सभी को OSSL-v2 के समान 9:1 प्रशिक्षण-परीक्षण विभाजन पर प्रशिक्षित किया गया; प्रशिक्षण के लिए 10 सेकंड के अंश लिए गए, जबकि अनुमान के समय मॉडल से पूरे इनपुट क्लिप की अवधि के बराबर संगीत बनवाया गया।

मूल्यांकन में सार्वजनिक-डोमेन परीक्षण समूह के साथ व्यावसायिक फिल्मों के 100 क्लिप वाला OES-Com समूह भी था। VidMuse में संवाद जोड़ने पर दोनों समूहों में संदर्भ संगीत से जोड़ीगत समानता के माप सुधरे। Diff-V2M में भी कुछ जोड़ीगत माप बेहतर हुए, लेकिन सभी वितरण-संबंधी माप उसी दिशा में नहीं गए।

GVMGen महत्वपूर्ण अपवाद रहा। OES-Com में उसका एक जोड़ीगत माप सुधरा, पर OSSL-v2 परीक्षण समूह में CLAP समानता 0.43 से 0.39 हुई और KL मान 0.72 से 0.73 हो गया, जहाँ कम KL बेहतर माना गया था। इसलिए परिणाम का सटीक अर्थ यह है कि संवाद कुछ संरचनाओं में उपयोगी अतिरिक्त संकेत बना, न कि उसने हर मॉडल की संगीत गुणवत्ता बढ़ा दी।

अलग किए गए संवाद में बचा हुआ संगीत परिणाम को प्रभावित कर सकता था। इसे जाँचने के लिए कम-अवशिष्ट-संगीत वाले उपसमूह भी परखे गए और मुख्य रुझान मोटे तौर पर बने रहे। फिर भी ये निष्कर्ष उसी पूर्वप्रकाशन के प्रयोग हैं; स्वतंत्र पुनरुत्पादन और अलग भाषाओं तथा फिल्म परंपराओं पर परीक्षण अभी उपलब्ध नहीं हैं।

−0.11 का अर्थ ‘संवाद से संगीत खराब’ नहीं है

OSSL-v2 में संवाद और संगीत की तीव्रता का कमजोर ऋणात्मक संबंध, जो सार्वभौमिक नियम नहीं है

OSSL-v2 में प्रति-फ्रेम संवाद और संगीत की ध्वनि-तीव्रता के बीच पियर्सन सहसंबंध −0.11 दर्ज हुआ। यह कमजोर ऋणात्मक संबंध बताता है कि इस संग्रह में अधिक मुखर संवाद वाले क्षण औसतन कुछ कम तेज संगीत के साथ पाए गए। यह संगीत की गुणवत्ता का माप नहीं है और कारण-परिणाम भी सिद्ध नहीं करता।

दृश्य का भाव, संपादन, फिल्म की शैली और मूल ध्वनि-मिश्रण संवाद तथा संगीत दोनों को प्रभावित कर सकते हैं। मॉडल में भी −0.11 को किसी कठोर नियम की तरह लागू नहीं किया गया; संवाद की स्थानीय ध्वनिक जानकारी केवल एक अतिरिक्त संकेत है, जिसके उपयोग का प्रभाव मॉडल संरचना पर निर्भर रहा।

फिलहाल OSSL-v2 एक उपलब्ध, स्वयं होस्ट किया गया सार्वजनिक-डोमेन फिल्म संग्रह और संवाद-सचेत प्रयोग का पूर्वप्रकाशित आधार है। आगे दो बातें स्पष्ट होनी बाकी हैं: शोधपत्र में उल्लिखित 1,886 स्रोत फिल्मों और जारी मेटाडेटा की 1,812 प्रविष्टियों का अंतर, तथा क्या स्वतंत्र समूह समान प्रशिक्षण स्थितियों में संवाद से मिले मिश्रित लाभ को दोहरा पाते हैं।

यह भी पढ़ें:

साझा करें:

हमारे न्यूज़लेटर की सदस्यता लें

Web3, AI और क्रिप्टो की नवीनतम खबरें सीधे अपने इनबॉक्स में पाएँ।

0