گیت‌هاب معیار متن‌باز ReviewBench را برای ارزیابی بازبینی کد معرفی کرد

گیت‌هاب معیار متن‌باز ReviewBench را برای ارزیابی بازبینی کد معرفی کرد

آنچه در این مقاله مطالعه می‌کنید:

۱۴ مهر ۱۴۰۵

۱۴ مهر ۱۴۰۵

گیت‌هاب ReviewBench را به‌عنوان یک معیار باز و قابل‌بازتولید برای سنجش عامل‌های هوش مصنوعیِ بازبینی کد عرضه کرده است. به گزارش GitHub Blog، این معیار با تکیه بر Pull Requestهای واقعی، مجموعه مرجع چندمنبعی و سنجه‌هایی نزدیک به شرایط عملیاتی طراحی شده تا توانایی سامانه‌ها در کشف ایرادهای کد با دقت بیشتری مقایسه شود.

نسخه پیش‌نمایش پژوهشی ReviewBench هم‌اکنون در دسترس است و توسعه‌دهندگان می‌توانند داده‌های آن را بررسی کنند، عامل‌های مختلف را در جدول رتبه‌بندی مقایسه کنند یا سامانه خود را با روش ارزیابی مشترک بسنجند.

ReviewBench چگونه ساخته شده است؟

گیت‌هاب برای شناخت الگوی واقعی بازبینی کد، توزیع ۱۰۳.۹ میلیون Pull Request را تحلیل کرده است. مجموعه نهایی ReviewBench شامل ۲۱۹ Pull Request از ۱۸۷ مخزن عمومی متن‌باز و ۱۹ زبان برنامه‌نویسی است. توزیع زبان‌ها و اندازه مخزن‌ها با الگوی کلی گیت‌هاب هماهنگ شده، اما نمونه‌ها به‌گونه‌ای وزن‌دهی شده‌اند که تغییرات بسیار کوچک بر مجموعه غالب نباشند.

برای ساخت مجموعه مرجع، یافته‌های بازبین‌های انسانی، تغییرات بعدی نویسندگان کد، ابزارهای تحلیل قطعی و چند مدل زبانی پیشرفته گردآوری شده‌اند. یافته‌های هم‌معنا پس از حذف موارد تکراری، با یک دستورالعمل واحد سنجیده می‌شوند. ReviewBench برای داوری از Claude Sonnet 5 استفاده می‌کند و گیت‌هاب دستورالعمل ارزیابی و داور مورد استفاده را نیز منتشر کرده است.

هر یافته بر اساس شدت و دسته‌بندی‌هایی مانند صحت، امنیت، قابلیت اطمینان، نگهداشت‌پذیری و آزمون برچسب می‌خورد. سنجه‌های grounded عملکرد را در برابر یافته‌های از پیش شناخته‌شده می‌سنجند و سنجه‌های augmented به عامل اجازه می‌دهند برای کشف ایرادهای معتبر خارج از مجموعه مرجع نیز امتیاز بگیرد. کاربران همچنین می‌توانند وزن دقت یا پوشش را در امتیاز Fβ تغییر دهند.

اعتبارسنجی و کاربرد عملی معیار جدید

پیش از انتشار، مهندسان ارشد مستقلی تمام یافته‌های مرجع را دوباره برچسب‌گذاری کردند و میزان توافق قضاوت آن‌ها با ReviewBench به ۹۶.۶ درصد رسید. گیت‌هاب همچنین داده‌ها، داور و ابزار تطبیق را نسخه‌بندی می‌کند تا نتایج در یک پیکربندی یکسان قابل مقایسه باشند.

این شرکت ReviewBench را در ارزیابی نسخه‌های پیاپی Copilot code review به کار گرفته است. در یک آزمایش مربوط به ترکیب چند مدل، پیش‌بینی آفلاین معیار با جهت نتایج آزمون آنلاین هم‌سو بود: نرخ رسیدگی به نظرها ۸ درصد، پوشش ۱۳.۶ درصد و حجم نظرها ۶۱ درصد افزایش یافت و هزینه هر بازبینی ۸ درصد کاهش پیدا کرد.

تیم‌های توسعه نرم‌افزار می‌توانند با اجرای عامل خود روی مجموعه آزمایشی ۲۵ موردی، تنظیمات را اصلاح کنند و سپس ارزیابی کامل ۲۱۹ Pull Request را در سه دور انجام دهند. در مجموع، ReviewBench چارچوبی عمومی برای مقایسه شفاف‌تر عامل‌های بازبینی کد فراهم می‌کند؛ هرچند گیت‌هاب تأکید دارد که آزمون‌های آنلاین همچنان معیار نهایی اثر واقعی بر کاربران هستند.