Google і DeepMind представили Dream‑RSI: рекурсивне самовдосконалення ШІ
Дослідники Google та DeepMind представили Dream‑RSI — агент, який рекурсивно покращує стратегію дослідження, скорочуючи виклики до 162 раз і підвищуючи якість результатів.
Фільтр по тегу
Дослідники Google та DeepMind представили Dream‑RSI — агент, який рекурсивно покращує стратегію дослідження, скорочуючи виклики до 162 раз і підвищуючи якість результатів.
У Recurrent Looped Transformer декодер стає рекурентним для кожного токена, використовуючи KV‑пам’ять, кеш активізацій і зберігає стан між запитом і відповіддю.
Harness-1 — пошуковий агент на 20B параметрів, що виносить стан пошуку в зовнішній harness-шар і конкурує з більшими моделями на довгих задачах.
RL_Envs_101 допомагає створювати RL-середовища в OpenEnv, OpenReward, Verifiers, NemoGym тощо, з прикладами та установкою через npx.