GitHub Copilot эсвэл Amazon Q: хуучин benchmark өнөөгийн агентыг шийдэхгүй

|Зохиогч: QUASA редакцын баг|6 мин уншина| 1
GitHub Copilot эсвэл Amazon Q: хуучин benchmark өнөөгийн агентыг шийдэхгүй

GitHub дахь issue, pull request-ээр ажлаа удирддаг багт GitHub Copilot илүү ойр сонголт. AWS орчинд ажилладаг, Java төслөө шинэчлэх шаардлагатай бөгөөд Amazon Q Developer-ийн одоогийн бүртгэлтэй багт Q илүү хэрэгтэй байж болно. Сонголтыг хуучин код гүйцээх туршилтын оноогоор бус, багийн ажлын урсгал, агентын хэрэглээ болон үйлчилгээний дэмжлэгээр хийх нь зүйтэй.

Шинээр Q Developer-ийн IDE хэрэглээг эхлүүлэх гэж буй багт бүртгэлийн боломж шийдвэрлэх нөхцөл болжээ. AWS-ийн шилжилтийн мэдэгдэлд шинэ Q Developer бүртгэл, төлбөртэй захиалга үүсгэхийг 2026 оны тавдугаар сарын 15-наас зогсоож, IDE залгаас болон төлбөртэй захиалгын дэмжлэгийг 2027 оны дөрөвдүгээр сарын 30-нд дуусгахаар заасан; одоогийн захиалгад хэрэглэгч нэмж болох бөгөөд AWS Management Console дахь Q тусламж энэ өөрчлөлтөд хамаарахгүй. Иймээс шинэ баг Q-ийн үнийн хүснэгтийг шинэ IDE захиалга авах боломжтой гэсэн баталгаа гэж үзэж болохгүй.

GitHub ба AWS дахь ажилд аль нь ойр вэ?

Copilot-ийн давуу тал GitHub дээр эхэлж, GitHub дээр хянагддаг өөрчлөлтөд тод харагдана. GitHub-ийн Copilot агентын тайлбарт cloud agent нь issue-ээс даалгавар авч салаа үүсгэн, код өөрчилж, pull request нээж чаддаг; CLI нь орон нутгийн файлуудыг өөрчилж, команд ажиллуулдаг гэжээ. Энэ нь багийн танил review, CI, нэгтгэх урсгалд агентын үр дүнг оруулах боломж өгнө. Хүний хяналт хэвээр шаардлагатай: агентын санал синтаксийн хувьд боломжийн харагдсан ч шаардлагыг буруу ойлгосон эсвэл аюулгүй байдлын асуудалтай байж болно.

AWS-ийн нөөц, үйлчилгээний тухай асуулт өдөр тутмын ажлын нэг хэсэг бол Q Developer-ийн AWS орчинтой уялдаа үнэ цэнтэй. Одоогийн Q хэрэглэгч IDE болон CLI дахь чат, агент кодчиллыг ашиглаж, Java шинэчлэлтийн ажлыг мөн энэ орчинд төлөвлөж болно. Гэхдээ AWS хэрэглэдэг төсөл бүрийн кодын хамтын ажиллагаа AWS-д төвлөрдөггүй. Кодын өөрчлөлтийг GitHub issue, pull request, review-ээр удирддаг бол Copilot-ийн тэр урсгалтай нийцэх байдал илүү жинтэй; үүлэн дэд бүтцийн асуулт тусдаа хэрэгцээ хэвээр үлдэнэ.

IDE дотор нэг мөрийн санал авах, олон файл дамнасан даалгаврыг агентад өгөх хоёр өөр ажил. Богино саналд хариулах хугацаа, хэлний дэмжлэг чухал байхад олон файлтай өөрчлөлтөд агент ямар файлыг зассан, ямар тест ажиллуулсан, үр дүн нь review-д хэр ойлгомжтой орж байгааг харах хэрэгтэй. CLI ашигладаг багт бас нэг ялгаа бий: команд ажиллуулах болон файл өөрчлөх эрх нь бодит ажлын хүрээг тэлдэг тул гарсан diff, тестийн алдаа, нэмэгдсэн хамаарлыг хүн хянах ёстой.

Сарын үнэ, лимитийг ижил нэгж гэж үзэж болохгүй

GitHub-ийн Copilot төлөвлөгөөний хүснэгтэд хувь хүний Pro сарын 10 ам.доллар бөгөөд нийт 1500 AI credit, байгууллагын Business нэг суудалд сарын 19 ам.доллар бөгөөд хэрэглэгч тутамд 1900 AI credit багтана. Business-ийн credit байгууллагын хамтын санд ордог; төлбөртэй төлөвлөгөөний код гүйцээх болон дараагийн засварын саналууд AI credit зарцуулахгүй. Харин чат, CLI, агентын ажилд зарцуулах credit нь ашигласан загвар болон боловсруулсан токеноос шалтгаална. Иймээс нэг урт агентын даалгаврыг олон богино кодын саналтай зөвхөн хүсэлтийн тоогоор нь дүйцүүлэх боломжгүй.

AWS-ийн Q Developer үнийн нөхцөлд Pro нэг хэрэглэгчид сарын 19 ам.доллар, үнэгүй түвшинд сарын 50 agentic request гэж заасан; IDE эсвэл CLI дахь асуулт хариултын чат болон агент кодчиллын харилцан үйлдэл хоёулаа энэ тоолуурт орно. Pro-д ч агентын хэрэглээний хязгаар бий. Java шинэчлэлтийн Pro эрх нь хэрэглэгч тутамд сарын 4000 кодын мөрөөр тооцогдож, төлбөр төлөгч AWS дансны түвшинд нэгтгэгдэнэ; багтсан хэмжээнээс хэтэрсэн, шинэчлэлтийн санал гарсан мөр тутамд 0.003 ам.долларын төлбөр ногдоно. Шинэ IDE бүртгэлийн хязгаарлалтаас шалтгаалан энэ үнэ нь одоогийн хэрэглэгчийн зардлыг үнэлэхэд илүү шууд хэрэглэгдэнэ.

AI credit, agentic request, шинэчлэх кодын мөр нь хоорондоо хөрвөдөг нэгж биш. Жишээлбэл, IDE дотор олон богино асуулт тавьдаг Q хэрэглэгч агентын том өөрчлөлт цөөн хийсэн ч хүсэлтийн лимитдээ ойртож болно. Copilot Business-д харин идэвхтэй хэрэглэгч бусдын ашиглаагүй credit-ээс хамтын сангаар дамжин хүртэх боломжтой. Монголын баг төсвөө төгрөгөөр баталдаг бол ам.долларын суурь үнийг төлбөр хийх үеийн ханш, байгууллагын худалдан авалтын нөхцөлтэй хамт тооцох шаардлагатай. Ижил суурь үнэ нь ижил хэрэглээний багц, ижил удирдлагын эрх гэсэн үг биш.

Гурван төрлийн ажил сонголтыг яаж өөрчлөх вэ?

Доорх нөхцөлүүд нь бүтээгдэхүүний гүйцэтгэлийн хэмжсэн үр дүн биш, багийн бодит хэрэгцээг ялгах шийдвэрийн хүснэгт юм. Ажлын хэмжээ өсөх тусам жижиг кодын саналын чанараас гадна хяналтын урсгал, хэрэглээний лимит, үйлчилгээний хугацаа илүү нөлөөлнө.

  • Жижиг Python даалгавар. Оролтын алдааг боловсруулдаг нэг функц, түүнд тохирох тест нэмэх ажлыг төсөөлье. Аль хэрэгсэл зөв санал гаргасныг ижил тест болон хүний хийх засварын хэмжээгээр харьцуулж болно. Ийм богино ажил зонхилдог багт том төслийн агентын боломж лицензийн гол үндэслэл болохгүй. IDE дахь саналын тохироо, чатанд тавих асуултын давтамж, багийн одоогийн бүртгэл илүү шууд нөлөөлнө. Хуучин Python бодлогын оноо энэ нөхцөлийн талаар хязгаарлагдмал ойлголт өгч болох ч өнөөгийн үйлчилгээний үнэ, эрхийг хэлж өгөхгүй.
  • Репозиторийн түвшний өөрчлөлт. API-ийн нэг өөрчлөлт код, тест, хэрэглээний баримтжуулалтад зэрэг нөлөөлнө гэж төсөөлье. GitHub дээр ажилладаг багт Copilot-ийн үүсгэсэн салаа, pull request, review-д орох diff нь танил урсгалд багтах давуу талтай. Одоогийн Q хэрэглэгч IDE эсвэл CLI дахь агентын санал, олон файлд хийсэн өөрчлөлт, ажиллуулсан тестээ өөрийн review урсгалд шилжүүлж үнэлнэ. Энд хурдан файл зассан эсэхээс гадна засварын шалтгаан ойлгомжтой, тест нь хангалттай, нэгтгэхэд бэлэн эсэх чухал.
  • Java шинэчлэлт. Хуучин хэлний хувилбар, сангийн хамаарлыг шинэчлэх ажилд Q Developer-ийн тусгай хувиргалт болон мөрөөр тооцох эрхийг харгалзана. Одоогийн төлбөртэй Q хэрэглэгчид энэ нь ажлын цар хүрээг тооцох суурь болж болох ч IDE дэмжлэгийн дуусах хугацаанаас өмнө багтаах шаардлагатай. Шинэ багт AWS-ийн заасан Kiro болон AWS Transform custom руу шилжих чиглэл сонголтод орно. Copilot-оор мөн код засварлуулж болох ч ердийн агентын өөрчлөлтийг тусгай Java хувиргалттай ижил ажил гэж урьдчилан үзэх үндэсгүй. Аль хэрэгслийн үр дүн байсан ч бүтээц, тест, хамаарлын нийцлийг баг өөрөө баталгаажуулна.

Хуучин HumanEval оноо юуг хэмжсэн бэ?

2023 оны HumanEval судалгаанд 164 Python бодлогоор тухайн үеийн GitHub Copilot болон Amazon CodeWhisperer-ийг шалгаж, тест давсан байдлыг нэгтгэсэн дундаж correctness оноог тус тус 59.85% ба 51.95% гэж тооцсон. Энэ нь бүх бодлогыг бүрэн зөв шийдсэн хувь биш: судалгаанд бүрэн зөв гаргалтын хувь Copilot-д 46.3%, CodeWhisperer-д 31.1% байсан. Дундаж оноонд хэсэгчлэн тест давсан хариултууд орсон учраас хоёр төрлийн хувийг хооронд нь сольж тайлбарлавал үр дүн гажна.

Туршсан Amazon бүтээгдэхүүн нь CodeWhisperer, харин өнөөгийн сонголтын нөгөө тал нь Amazon Q Developer-ийн агент юм. Нэг функцийн Python бодлого нь GitHub pull request-ийн хяналт, CLI дахь олон алхамтай засвар эсвэл Java төслийн хувиргалтыг хэмжээгүй. Тиймээс тэр үеийн онооны зөрүүг Q агент өнөөдөр Copilot-оос төдий хэмжээгээр хоцордог гэсэн дүгнэлт болгож болохгүй. Багийн хувьд жижиг функц, олон файлтай өөрчлөлт, Java шинэчлэлт тус бүр өөр шалгууртай; үйлчилгээний дэмжлэгийн хугацаа болон сарын хэрэглээний зардал нь эдгээрийн үр дүнтэй хамт сонголтыг шийднэ.

Мөн уншаарай:

Хуваалцах:

Мэдээллийн товхимолд бүртгүүлэх

Web3, AI болон криптоны шинэ мэдээг шууд имэйл хайрцагтаа аваарай.

0