Компания «Т-Технологии» разработала два метода для оценки генерации тестов большими языковыми моделями — TAM-Eval и RM-RF. TAM-Eval анализирует, как LLM решают задачи сопровождения Unit-тестов в репозиториях: создают их, исправляют или обновляют. RM-RF — это модель, которая до сборки и запуска проекта прогнозирует, выполнится ли сгенерированный LLM тест и улучшит ли он качество проверки кода.
В «Т-Технологиях» называют методы взаимодополняющими. TAM-Eval моделирует сценарии сопровождения тестов на уровне тест-файлов с учетом контекста репозитория. Качество оценивается без ручных эталонных ответов и с реальным прогоном. RM-RF обучается без запуска кода предсказывать, выполнится ли тест корректно, увеличит ли он покрытие и улучшит ли способность выявлять ошибки.
В TAM-Eval сформирован воспроизводимый набор из 1,5 тыс. сценариев сопровождения тестов на Python, Java и Go в 192 репозиториях. RM-RF обучен и протестирован почти на 22,3 тыс. примерах.
Как отмечают в компании, новые методы снимают два ограничения автоматической генерации тестов с помощью LLM — нереалистичность экспериментальных постановок и высокую стоимость обратной связи. Обе разработки ориентированы на использование в инженерных процессах в таких сферах, как FinTech, E-commerce, телеком, промышленность, энергетика и транспорт.
Нажимая на кнопку, вы соглашаетесь с политикой конфиденциальности
ICT.Moscow — открытая площадка о цифровых технологиях в Москве. Мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров.