
ԱԲ prompt-ը փոխելուց առաջ ստեղծեք eval․ «լավ է թվում»-ը չափում չէ

Prompt-ի կամ մոդելի փոփոխությունը գնահատելու համար նախ հավաքեք իրական հարցերն ու սխալները, յուրաքանչյուր օրինակի համար սահմանեք ընդունելի վարքը և նույն օրինակներով ստուգեք հին ու նոր տարբերակները։ Միայն պատասխանը կարդալով ստացած տպավորությունը չափում չէ. OpenAI-ի գնահատման լավագույն փորձի ուղեցույցը խորհուրդ է տալիս սահմանել նպատակը, հավաքել տվյալներ, ընտրել չափանիշներ և կրկնել համեմատությունը։
Փոքր թիմը կարող է սկսել պայմանական 30 օրինակով հավաքածուից։ Յուրաքանչյուր պահանջի համար առանձին գնահատիչ ընտրեք, ընդունման շեմը գրեք մինչև արդյունքները տեսնելը և համեմատեք նաև այն դեպքերը, որտեղ նոր տարբերակը ձախողվել է։ Այսպես կերևա՝ փոփոխությունն ուղղե՞լ է կարևոր սխալը, թե՞ պարզապես փոխել է պատասխանի ձևակերպումը։
Սխալը վերածեք հավաքածուի տողի
Յուրաքանչյուր տողում պահեք օգտատիրոջ մուտքը, մոդելին հասանելի համատեքստը, սպասվող վարքը, անթույլատրելի սխալը և գնահատվող պահանջը։ Ավելացրեք կայուն նույնացուցիչ ու նշեք՝ օրինակը ծագել է արտադրական միջադեպի՞ց, օգտատիրոջ դիտարկումի՞ց, թե՞ մասնագետի կազմած փորձարկումից։ Եթե իրական հարցումը անձնական տվյալներ ունի, դրանք փոխարինեք այնպես, որ խնդրի կառուցվածքը և սխալի պատճառը պահպանվեն։
Մեկնարկային ձևանմուշը կարող է ներառել 18 սովորական հարցում, 6 արդեն հանդիպած սխալ և 6 հազվադեպ կամ հակասական դեպք։ Այդ բաժանումը խմբագրական առաջարկ է, ոչ վիճակագրական երաշխիք. փոխեք այն ըստ ձեր արտադրանքի ռիսկերի։ Սովորական հարցումները ցույց են տալիս հիմնական ծառայության որակը, նախկին սխալները՝ արդյոք շտկումն աշխատել է, իսկ հազվադեպ դեպքերը՝ արդյոք բարելավումը նոր խոցելիություն է ստեղծել։
Եթե ճիշտ պատասխանը միակը չէ, տողում գրեք ընդունելի վարքի սահմանները. որ փաստը պարտադիր է, ինչ անորոշություն պետք է նշվի և որ գործողությունն է արգելված։ Օրինակ՝ պայմանական աջակցման հարցում կարելի է ընդունել տարբեր քաղաքավարի ձևակերպումներ, բայց պահանջել, որ պատասխանը չխոստանա վերադարձ, երբ ներկայացված տվյալներով դրա իրավունքը դեռ պարզ չէ։ Այդպիսի կանոնը գնահատելի է, մինչդեռ «պատասխանը լավն է» նշումը հաջորդ փորձարկմանը չի օգնի։
OpenAI-ի Datasets-ի ուղեցույցը նկարագրում է CSV-ից մուտքային ու հղման տվյալներ ներմուծելը, արդյունքները նշագրելը և պահպանված գնահատիչներով prompt-ի տարբերակները համեմատելը, բայց նաև նշում է, որ Evals հարթակում գոյություն ունեցող գնահատումները 2026 թվականի հոկտեմբերի 31-ին նախատեսվում է դարձնել միայն ընթերցելի, իսկ հարթակը՝ դադարեցնել նոյեմբերի 30-ին։ Ուստի հավաքածուի տողերը, սպասվող արդյունքները և գնահատման կանոնները պահեք նաև ձեր վերահսկած ֆայլում կամ համակարգում։
Գնահատիչը ընտրեք ըստ ստուգվող պահանջի
Որոշման առաջին հարցն է՝ ճիշտ պատասխանը հնարավոր է արդյոք ստուգել հստակ կանոնով։ OpenAI-ի գնահատիչների փաստաթուղթը ներկայացնում է տողային համընկնման, տեքստային նմանության, մոդելային գնահատման և Python կոդով ստուգման տարբերակներ. դրանցից յուրաքանչյուրը չափում է պահանջի այլ կողմ։
- Եթե պահանջվում է հայտնի արժեք կամ ճշգրիտ պիտակ, օգտագործեք տողային համընկնում։ Նախ որոշեք՝ մեծատառը, բացատը կամ նույն արժեքի այլ գրությունը պե՞տք է համարվեն սխալ։
- Եթե ճիշտ իմաստը կարելի է արտահայտել տարբեր բառերով, տեքստային նմանությունը կարող է օգտակար լինել որպես ազդակ։ Առանձին ստուգեք պարտադիր փաստերը. իմաստով մոտ պատասխանը կարող է բաց թողնել վճռորոշ պայմանը։
- Եթե պահանջը միանշանակ հաշվելի է՝ դաշտի առկայություն, թույլատրելի ձևաչափ կամ երկարության սահման, կիրառեք կոդային ստուգում։ Այն պետք է ստուգի հենց պահանջը, այլ ոչ պատասխանի ընդհանուր տեսքը։
- Եթե գնահատվում է բաց պատասխանի հիմնավորվածությունը, ընտրեք մոդելային գնահատիչ։ Նրան տվեք հստակ սանդղակ, ընդունելի ու թույլ պատասխանների օրինակներ և գնահատականի պատճառը նշելու պահանջ։
Պարտադիր պայմաններն ու որակական հատկանիշները գրանցեք առանձին։ Եթե, օրինակ, պատասխանը պետք է պարունակի որոշակի սահմանափակում, դրա բացակայությունը թող լինի ինքնուրույն ձախողում։ Սահուն լեզվի բարձր միավորը չպետք է փոխհատուցի այդ բացթողումը։
Համաձայնեցրեք ավտոմատ գնահատականը մարդու որոշման հետ
Մինչ գնահատիչը կդառնա թողարկման չափանիշ, ոլորտը հասկացող մարդը թող նշագրի լավ, միջին և թույլ պատասխաններ՝ նշելով որոշման պատճառը։ Նույն պատասխանները գնահատեք ավտոմատ եղանակով և ուսումնասիրեք անհամաձայնությունները։ Եթե մարդը մերժում է պատասխանը բաց թողնված պարտադիր փաստի պատճառով, իսկ գնահատիչը բարձր միավոր է տալիս, ճշտեք գնահատման կանոնը կամ ավելացրեք առանձին պարտադիր ստուգում։
Պիտակներով առաջադրանքում ստուգեք՝ արդյոք հավաքածուում գերակշռում է մեկ պիտակ. հակառակ դեպքում միշտ այդ պիտակն ընտրող տարբերակը կարող է թվալ հաջող։ Բաց պատասխանների դեպքում փորձարկեք գնահատիչը տարբեր որակի մի քանի պատասխաններով և հետևեք՝ նույն չափանիշը կայո՞ւն է կիրառվում։ Զույգ պատասխանների համեմատության ժամանակ փոխեք դրանց հերթականությունը. դատավոր մոդելի ընտրության վրա կարող են ազդել պատասխանի դիրքն ու երկարությունը։
Համեմատեք տարբերակները նույն պայմաններով
Ամրագրեք հավաքածուի տարբերակը, գնահատիչների կանոններն ու ընդունման շեմը, ապա գործարկեք ելակետային և նոր տարբերակները նույն մուտքերով։ Եթե փոխվում է միայն prompt-ը, անփոփոխ պահեք մոդելը, գործիքները, տրամադրված համատեքստը և գեներացման կարգավորումները։ Մոդելը փոխելիս նույնը պահեք prompt-ը և մյուս պայմանները, որպեսզի արդյունքի տարբերությունը հնարավոր լինի կապել տվյալ փոփոխության հետ։
Համեմատությունը կատարեք տող առ տող. նշեք ուղղված սխալները, պահպանված հաջողությունները և նոր ձախողումները։ Տատանվող պատասխանների դեպքում կարևոր օրինակները մի քանի անգամ գործարկեք նույն պայմաններով և պահեք բոլոր ելքերը։ Փոքր հավաքածուի ընդհանուր հաջողության տոկոսը դիտեք խմբերի արդյունքների կողքին. սովորական հարցումների լավ ցուցանիշը կարող է թաքցնել նախկին սխալի կրկնությունը։
Շեմը կապեք թողարկման որոշման հետ
Շեմը սահմանեք մինչև նոր տարբերակի միավորները տեսնելը։ Պայմանական 30 օրինակով ձևանմուշի համար թիմը, օրինակ, կարող է պահանջել, որ տարբերակը ուղղի նախկին 6 սխալներից առնվազն 2-ը և պարտադիր պայմանների ստուգումներում նոր ձախողում չունենա։ Սա միայն որոշման կանոնի օրինակ է. իրական շեմը կախված է սխալի հետևանքից և այն պահանջներից, որոնց խախտմամբ թողարկումն անընդունելի է։
Վերջում նայեք նաև բարձր միավոր ստանալու մակերեսային հնարքներին. տարբեր հարցերի տրվո՞ւմ է նույն անվտանգ, բայց անօգուտ պատասխանը, կրկնվո՞ւմ են գնահատիչին հաճելի բառերը՝ առանց պահանջը կատարելու, կամ արդյունքը բարձրանո՞ւմ է գերակշռող պիտակի հաշվին։ Եթե ավտոմատ միավորը լավանում է, իսկ մարդու նշագրումը՝ ոչ, վերանայեք գնահատիչը և խնդրահարույց տողը։ Յուրաքանչյուր հաստատված նոր արտադրական սխալ ավելացրեք հավաքածուին՝ սպասվող վարքով ու ծանրության նշումով, որպեսզի հաջորդ փոփոխությունը ստուգվի նաև դրա դեմ։
Կարդացեք նաև:
Առնչվող հոդվածներ


Գաղտնի տվյալը մի՛ տեղադրեք ԱԲ prompt-ում․ պաշտպանեք նաև հիշողությունն ու մատյանները

Prompt cache-ը խնայում է մինչև 80%, եթե գործիքները չեն կոտրում prefix-ը

OpenAI-ի տեքստային ջրանիշը խմբագրումից հետո ճանաչվում է ընդամենը 17%-ով

Playwright թե Cypress․ արագ թեստը կարող է պահանջել նոր աշխատանքային հոսք

Thunderbird 157-ը փակում է բարձր վտանգի խոցելիություններ և շտկում 100% CPU-ն
Բաժանորդագրվեք մեր տեղեկագրին
Ստացեք Web3-ի, ԱԲ-ի և կրիպտոյի վերջին լուրերն անմիջապես ձեր էլ. փոստին։