Модель чи обв’язка: класифікація збоїв ІІ-агентів у продакшені
Модель чи обв’язка?
Якщо ви розробляєте ІІ-агентів для продакшену, цю статтю варто зберегти.
Автори зібрали 41 типовий сценарій відмови й класифікували їх за тим, на стику яких компонентів виникає проблема. Кожна помилка прив’язується до взаємодії між моделлю, обв’язкою, користувачем, інструментами, пам’яттю чи оточенням, а також указує, на чиєму боці причина і де її потрібно виправляти.
Це добре відображає реальну картину: більшість проблем ІІ-агентів виникає не в самій моделі, а на стику моделі та інфраструктури, що її оточує.
Підхід також придатний для автоматичного аналізу. У тестах на чотирьох передових моделях найкращий ІІ-суддя досяг коефіцієнта узгодженості Коена 0,76 порівняно з ручною розміткою. Це дає змогу автоматично класифікувати помилки прямо в продакшені, а не розбирати їх вручну після кожного інциденту.
Цього року інженерія обв’язки стала одним із головних чинників якості ІІ-агентів, але спільної мови для розмежування помилок моделі та помилок обв’язки досі не було. Ця робота якраз пропонує таку систему.
Стаття: https://arxiv.org/abs/2607.28802