О качестве проверки мы до сих пор знали только «механизм жив»: находит подброшенный фрагмент. Продукт при этом продаёт процент заимствований, за который никто не ручался — неизвестно было ни сколько списываний система пропускает, ни как часто обвиняет невиновных. Бенчмарк делает из документов корпуса «студенческие работы» четырёх видов и гоняет их через настоящий путь L1. Первый замер на проде: дословно 100% найдено лёгкий рерайт 100% найдено сильный рерайт 0% — это работа L3/L4, не L1 оригинал 0% ложных обвинений То есть основа работает как задумано. Показательно другое: из 20 взятых документов в замер попали 8 — у остальных нет полного текста нужной длины. Узкое место не алгоритм, а глубина корпуса. Запускать после изменения порогов и параметров winnowing — иначе непонятно, улучшение сделано или ухудшение. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
9.4 KiB
9.4 KiB