Claude виконує основну частину роботи вже у 26% завдань, пов’язаних із дослідженням і розробкою майбутніх моделей Anthropic. Ще у лютому 2026 року цей показник становив менше ніж 1%, пише компанія.
Йдеться про завдання, які Claude може майже повністю виконати після отримання загальної вказівки від людини. Працівник при цьому контролює процес і перевіряє результат. У понад 90% дослідницьких і розробницьких завдань Claude принаймні виконує значні частини роботи під керівництвом людини.
Повністю автономно Claude поки не працює у жодній із проаналізованих категорій. Anthropic розглядає цей показник як спосіб оцінити наближення до рекурсивного самовдосконалення, коли модель зможе самостійно створювати свого наступника.
Для оцінювання компанія проаналізувала близько 15 тисяч внутрішніх завдань і розподілила їх за рівнем автоматизації. Частину аналізу та оцінювання також виконував Claude, тому Anthropic визнає можливість похибок і відмінностей у трактуванні рівнів автоматизації.
На основній внутрішній платформі Anthropic одночасно працюють близько 30 тисяч ШІ-агентів для досліджень та інженерних завдань. У серпні системи моніторингу перевірили понад мільярд їхніх дій і заблокували 0,002%, або приблизно одну з 47 тисяч. Близько 50 найважливіших попереджень щотижня передають на перевірку людям.
Anthropic також проаналізувала використання обчислювальних ресурсів протягом одного тижня в липні. Близько 6% потужностей, витрачених на дослідження та розробку ШІ, спрямували на безпеку. Серед ресурсів, які використовували ШІ-агенти для розробки моделей, частка безпекових досліджень становила 12%.
Компанія закликає інших розробників публікувати аналогічні показники за спільною методикою та допускати до перевірки незалежних експертів. Такі дані мають показати, чи встигають системи контролю за темпами автоматизації розробки ШІ.
Нагадаємо, раніше генеральний директор Anthropic Даріо Амодей запропонував сповільнити розвиток штучного інтелекту, щоб заходи безпеки та державне регулювання встигали за можливостями нових моделей.



