گیتهاب ReviewBench را بهعنوان یک معیار باز و قابلبازتولید برای سنجش عاملهای هوش مصنوعیِ بازبینی کد عرضه کرده است. به گزارش GitHub Blog، این معیار با تکیه بر Pull Requestهای واقعی، مجموعه مرجع چندمنبعی و سنجههایی نزدیک به شرایط عملیاتی طراحی شده تا توانایی سامانهها در کشف ایرادهای کد با دقت بیشتری مقایسه شود.
نسخه پیشنمایش پژوهشی ReviewBench هماکنون در دسترس است و توسعهدهندگان میتوانند دادههای آن را بررسی کنند، عاملهای مختلف را در جدول رتبهبندی مقایسه کنند یا سامانه خود را با روش ارزیابی مشترک بسنجند.
ReviewBench چگونه ساخته شده است؟
گیتهاب برای شناخت الگوی واقعی بازبینی کد، توزیع ۱۰۳.۹ میلیون Pull Request را تحلیل کرده است. مجموعه نهایی ReviewBench شامل ۲۱۹ Pull Request از ۱۸۷ مخزن عمومی متنباز و ۱۹ زبان برنامهنویسی است. توزیع زبانها و اندازه مخزنها با الگوی کلی گیتهاب هماهنگ شده، اما نمونهها بهگونهای وزندهی شدهاند که تغییرات بسیار کوچک بر مجموعه غالب نباشند.
برای ساخت مجموعه مرجع، یافتههای بازبینهای انسانی، تغییرات بعدی نویسندگان کد، ابزارهای تحلیل قطعی و چند مدل زبانی پیشرفته گردآوری شدهاند. یافتههای هممعنا پس از حذف موارد تکراری، با یک دستورالعمل واحد سنجیده میشوند. ReviewBench برای داوری از Claude Sonnet 5 استفاده میکند و گیتهاب دستورالعمل ارزیابی و داور مورد استفاده را نیز منتشر کرده است.
هر یافته بر اساس شدت و دستهبندیهایی مانند صحت، امنیت، قابلیت اطمینان، نگهداشتپذیری و آزمون برچسب میخورد. سنجههای grounded عملکرد را در برابر یافتههای از پیش شناختهشده میسنجند و سنجههای augmented به عامل اجازه میدهند برای کشف ایرادهای معتبر خارج از مجموعه مرجع نیز امتیاز بگیرد. کاربران همچنین میتوانند وزن دقت یا پوشش را در امتیاز Fβ تغییر دهند.
اعتبارسنجی و کاربرد عملی معیار جدید
پیش از انتشار، مهندسان ارشد مستقلی تمام یافتههای مرجع را دوباره برچسبگذاری کردند و میزان توافق قضاوت آنها با ReviewBench به ۹۶.۶ درصد رسید. گیتهاب همچنین دادهها، داور و ابزار تطبیق را نسخهبندی میکند تا نتایج در یک پیکربندی یکسان قابل مقایسه باشند.
این شرکت ReviewBench را در ارزیابی نسخههای پیاپی Copilot code review به کار گرفته است. در یک آزمایش مربوط به ترکیب چند مدل، پیشبینی آفلاین معیار با جهت نتایج آزمون آنلاین همسو بود: نرخ رسیدگی به نظرها ۸ درصد، پوشش ۱۳.۶ درصد و حجم نظرها ۶۱ درصد افزایش یافت و هزینه هر بازبینی ۸ درصد کاهش پیدا کرد.
تیمهای توسعه نرمافزار میتوانند با اجرای عامل خود روی مجموعه آزمایشی ۲۵ موردی، تنظیمات را اصلاح کنند و سپس ارزیابی کامل ۲۱۹ Pull Request را در سه دور انجام دهند. در مجموع، ReviewBench چارچوبی عمومی برای مقایسه شفافتر عاملهای بازبینی کد فراهم میکند؛ هرچند گیتهاب تأکید دارد که آزمونهای آنلاین همچنان معیار نهایی اثر واقعی بر کاربران هستند.




