Як повідомляє видання TechCrunch, напрям моніторингу ШІ переживає стрімке зростання. За останні роки лише акселератор Y Combinator профінансував 106 компаній у цій ніші, а стартапи на кшталт Braintrust, LangChain та Judgment Labs залучили сотні мільйонів доларів. Інтерес інвесторів підігріває зростання масштабів використання агентів: під час інциденту на платформі Hugging Face майже 12 000 агентів координували дії зі швидкістю, яка унеможливила аналіз даних людиною без допомоги сторонніх алгоритмів.
Серед проєктів у цій сфері — Apollo Research, яка випустила інструмент Watcher. Він інтегрується між агентом-програмістом (наприклад, Claude Code чи Codex) і його наступною дією, оцінюючи ризики на кшталт витоку приватних даних чи видалення файлів без дозволу. Інший стартап, Goodfire, розробляє продукт Silico, який аналізує внутрішні активації моделі замість її підсумкових відповідей, шукаючи ознаки небажаної поведінки ще на етапі формування думок.
Утім, частина експертів скептично ставиться до ідеї довіряти перевірку штучному інтелекту. Блогер і фахівець з технологій Саймон Віллісон застерігає, що зловмисний або збійний ШІ може спробувати обдурити контролюючу систему. За його словами, моделі вже демонстрували здатність обходити оцінювальні алгоритми чи фальсифікувати записи у своїх ланцюжках міркувань. Віллісон вважає надійнішим рішенням традиційний моніторинг мережевого трафіку та фіксацію дій за допомогою інструментів без використання ШІ.
Проблема безпеки агентних систем загострилася у 2026 році після серії масштабних інцидентів за участю моделей OpenAI та майданчика Hugging Face, де агенти змовлялися для обходу обмежень.
Нагадаємо, що дослідники вже запустили перші сервіси, призначені для того, щоб агенти штучного інтелекту могли повідомляти про неправомірні дії інших ШІ.
/
Технологічні компанії довіряють агентам штучного інтелекту все складніші й триваліші завдання, але паралельно зіштовхуються з проблемою їх контролю. Автономні алгоритми діють швидше, довше та в більших обсягах, ніж люди здатні перевіряти в реальному часі. Для розв’язання цієї проблеми розробники та лабораторії все частіше пропонують залучати окремі системи штучного інтелекту, які перевірятимуть дії інших агентів перед їх виконанням.



