Опис набору даних
Задача представленого набору даних — систематизувати і зробити придатними для аналізу неструктуровані судові рішення. Набір даних призначений для проведення досліджень, моніторингу діяльності правоохоронних органів і судової системи.
Наразі він містить інформацію про:
- статті і пункти обвинувачення, додаткові модифікатори (готування, замах, співучасть)
- рішення стосовно кожної статті обвинувачення
- призначені покарання (позбавлення волі, штраф, обмеження волі, позбавлення права обіймати певні посади, іспитовий строк)
- інформацію про призначення покарань за сукупністю (ст. 70 і 71 КК), звільнення від відбування покарань (ст. 75 КК та інші)
Що входить у набір даних – 2026-07-09
- Тип документу: вирок
- Інстанція: Перша, Апеляційна
- Категорії рішень: Домашнє насильство, Умисне вбивство, Державна зрада, Комп'ютерні втручання
- Роки: 2020–2026
- Кількість обвинувачених: 1
Етапи обробки
Обробка виконується в наступних етапах:
- Завантаження вироків із ЄДРСР та розбиття кожного рішення на вступну, мотивувальну і резолютивну частини.
- Оцінка кількості обвинувачених за вступною частиною мовною моделлю gpt-4o-mini та звірка з наборами даних ДСА («Список справ, призначених до розгляду», «Стан розгляду справ»); документи, де оцінки розходяться, повторно аналізуються покращеним запитом.
- Розбиття резолютивних частин на сегменти, присвячені окремим статтям обвинувачення, і виокремлення даних про рішення й покарання за допомогою регулярних виразів.
- Узгодження виявлених парсером псевдонімів із псевдонімом обвинуваченого, визначеним LLM, і фільтрація до підмножини «один обвинувачений».
- Обчислення позначок якості (
quality_warn_charge/quality_warn_doc) — автоматичне позначення записів і документів, що потребують ручної перевірки — та формування окремих наборів для першої й апеляційної інстанцій.
Якість набору даних — 2026-07-09
Набір даних сформовано за допомогою регулярних виразів до резолютивних частин вироків. Через те, що судові рішення відрізняються за структурою, наразі набір містить певні помилки і втрати — але ми працюємо далі над тим, щоби мінімізувати їх. Поточна якість набору виглядає так:
- На основі проведеної вибіркової оцінки набору даних першої інстанції (n=100), оцінюємо, що 0,9% значень полів містять певні помилки.
- На основі проведеної вибіркової оцінки набору даних апеляційної інстанції (n=100), оцінюємо, що 7% значень полів містять певні помилки. Зважаючи на незначний обсяг апеляційних документів, рекомендуємо валідувати їх перед використанням.
- 340 (1,9%) записів статей обвинувачення в 251 документах (1,8%) мають позначку
quality_warn_charge, яка означає рекомендацію валідації значень перед використанням. - 137 документів (1,0%) мають позначку
quality_warn_doc, яка означає рекомендацію валідації документів перед використанням.
З питаннями та пропозиціями щодо роботи над набором відкритих даних, пишіть
Дмитро Лебедєв,
старший експерт сектору IT&Telecom BRDO
d.lebedyev@brdo.com.ua