О качестве проверки мы до сих пор знали только «механизм жив»: находит
подброшенный фрагмент. Продукт при этом продаёт процент заимствований, за
который никто не ручался — неизвестно было ни сколько списываний система
пропускает, ни как часто обвиняет невиновных.
Бенчмарк делает из документов корпуса «студенческие работы» четырёх видов и
гоняет их через настоящий путь L1. Первый замер на проде:
дословно 100% найдено
лёгкий рерайт 100% найдено
сильный рерайт 0% — это работа L3/L4, не L1
оригинал 0% ложных обвинений
То есть основа работает как задумано. Показательно другое: из 20 взятых
документов в замер попали 8 — у остальных нет полного текста нужной длины.
Узкое место не алгоритм, а глубина корпуса.
Запускать после изменения порогов и параметров winnowing — иначе непонятно,
улучшение сделано или ухудшение.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>