SAGEN-BENCH V2 · ПОПЕРЕДНЯ РЕЄСТРАЦІЯ

Памʼять працює. Вузьке місце у сприйнятті.

SAGEN дає ШІ-агентам структуровану робочу памʼять розмови: цілі, теми, що на що посилається. Перед перевіркою на 72 заморожених сценаріях на OSF подали чотири передбачення. Два справдилися. Два не справдилися, і тут вони опубліковані саме як провали.

Рисунок 1
Що зберігає кожен підхід до памʼяті: з ідеальними вхідними даними і коли читає реальна модель

Охоплення: яка частка того, що агент мав би відстежувати, справді потрапила в його памʼять, від 0 до 1.

Режим оракула: агент отримує ідеальне прочитання розмови. Це стеля. Режим наживо: реальна модель (Sonnet 4.6) читає розмову сама. Це реалістичний випадок. 72 сценаріїв у кожному режимі; заморожений аналіз потужності вимагав 66.
Рисунок 1 як таблиця
ПідхідОракулНаживоРозрив
Сирий буфер0,1600,1400,021
Повна стенограма0,1950,1740,021
Згорткове резюме0,2680,268-0,000
SAGEN @ 300 токенів0,9370,4990,438
SAGEN @ 2000 токенів0,9660,8280,138
OSF DOI 10.17605/OSF.IO/S3GFM ↗72 сценаріїв8 488 викликів моделей84,75 $ зі стелі 150 $

ЩО НЕ СПРАЦЮВАЛО І ЧОМУ

Два передбачення не справдилися. Обидва вказують на одне місце.

H3З ідеальними вхідними даними SAGEN охоплює 0,937; коли читає реальна модель, 0,499. Зареєстрована межа дозволяла розрив 0,10. Розрив склав 0,438.

H4Моделі збіглися з еталоном приблизно на чверть того, що сприйняли (узгодженість 0,257 проти порогу 0,80), і не були послідовними від запуску до запуску (0,719 проти 0,90).

Рисунок 2
Узгодженість сприйняття за моделлю

Частка сприйнятого кожною моделлю, що збіглася із замороженим еталоном. 5 запусків на 30 сценаріях для кожної моделі.

Рисунок 2 як таблиця
МодельУзгодженістьВипробуванняРоль
claude-haiku-4-5-202510010,251150порівняння
claude-sonnet-4-60,257150флагман, поріг H4
claude-opus-4-80,273150порівняння

Більша модель майже нічого не змінює.

Вузьке місце не в архітектурі, а в сприйнятті. Саме туди йде наступна робота.

ЗАРЕЄСТРОВАНІ ВЕРДИКТИ

Кожен вердикт, як його подали

Кожен критерій нижче записали й подали на OSF до того, як запустили оплачене вікно. Підтверджувальну родину скориговано методом Голма-Бонферроні при альфа 0,05. Відкрийте вердикт, щоб побачити зареєстрований критерій і виміряне значення.

Зареєстровані гіпотези

H1Чи перевершує SAGEN найкращу просту памʼять, коли читає реальна модель?ВИТРИМАЛА
Критерій і числа
Зареєстрований критерій
SAGEN @ 300 токенів зі сприйняттям наживо перевершує найсильнішу пласку базову лінію за охопленням
Виміряно
+0,230 охоплення понад згорткове резюме
95% ДІ
від 0,205 до 0,257
p
0,0001 (поріг Голма 0,0125)
H2Чи є структура, якої не втримує навіть повна стенограма?ВИТРИМАЛА
Критерій і числа
Зареєстрований критерій
7 структурних вимірів лишаються незахопленими повною стенограмою в кожному сценарії
Виміряно
порушень: 0 на 72 сценаріях
p
0,0001 (поріг Голма 0,0167)
H3Чи мало охоплення коштує те, що читає реальна модель?ПРОВАЛЕНА
Критерій і числа
Зареєстрований критерій
Охоплення наживо лишається в межах 0,10 від охоплення оракула
Виміряно
податок на сприйняття 0,438
95% ДІ
від 0,416 до 0,460
p
1,0000 (поріг Голма 0,0500)
H4Чи читає модель розмову точно й послідовно?ПРОВАЛЕНА
Критерій і числа
Зареєстрований критерій
Узгодженість щонайменше 0,80 і стабільність між запусками щонайменше 0,90
Виміряно
узгодженість 0,257; стабільність 0,719
p
0,0001 (поріг Голма 0,0250)

Таблиця Голма позначає H4 як значущу, бо її двобічне p виявляє лише віддаленість від порогу. Середнє лежить нижче порогу, тож спрямований критерій провалено. Див. розкриття.

Вторинні

S3Чи ламає вилучення кожного механізму саме те, що передбачили?ВИТРИМАЛА
Критерій і числа
Зареєстрований критерій
Усі 64 клітинок «вилучення x перевірка» поводяться так, як передбачили наперед
Виміряно
64/64 на замороженому корпусі з 72 сценаріїв

Контроль якості

IRRЧи погоджуються дві незалежні моделі-судді?ПРОВАЛЕНА
Критерій і числа
Зареєстрований критерій
Моделі-судді (2) досягають каппи Коена щонайменше 0,70
Виміряно
каппа 0,253 на 400 парних оцінках

Жоден із чотирьох вердиктів щодо гіпотез не використовує суддю; їх обчислено механічно, тож провал цього контролю їх не зачіпає.

S3 · РЕШІТКА ВИЛУЧЕНЬ

64 із 64 передбачень справдилися

Перед підтверджувальним запуском подали 64 передбачення: вилучіть один механізм SAGEN, і зламатися мають саме ці перевірки здатностей. Рядки - вилучений механізм; стовпці - перевірена здатність.

  1. P1Виявлення поворотів
  2. P2Тяглість прогресу
  3. P3Можливість повернення
  4. P4Загроза фрустрації
  5. P5Стійкість цілей
  6. P6Захоплення виведених цілей
  7. P7Згасання уваги
  8. P8Структура інʼєкції

Ця решітка - зафіксований результат на замороженому корпусі з 72 сценаріїв, той самий, який CI перевіряє на кожному коміті.

АБЛЯЦІЯ СТІЙКОСТІ · РЕЖИМ ОРАКУЛА

Чи виправдовує себе дошка?

Решітка вилучень прибирає механізми, але ніколи не прибирає саму стійкість. Ця безкоштовна детермінована абляція прибирає. Вона порівнює стійкий рушій із безстановою структурованою базовою лінією: щокроку новий рушій, який бачить лише аналіз цього кроку й вставляє його, нічого не несучи далі. Різниця за кожним виміром відокремлює охоплення, яке купує стійкість, від охоплення, яке типізована схема дає задарма.

+0,338середнє охоплення від стійкості (0,937 зі стійкістю проти 0,599 без стану, n = 72)
Рисунок 3
Що додає стійкість, вимір за виміром

Охоплення зі стійким рушієм мінус охоплення з безстановою структурованою базовою лінією, за кожним виміром, при бюджеті 300 токенів. Праворуч від нуля памʼять допомагає. Ліворуч вона коштує.

Рисунок 3 як таблиця
ВимірРізниця від стійкостіЯк читати
Явні цілі explicit-goal-identification+1,000потребує памʼяті
Виведені цілі inferred-goals+0,972потребує памʼяті
Повороти теми topic-pivot-detection+0,893потребує памʼяті
Активні теми active-topic-tracking+0,743потребує памʼяті
Пріоритет цілей goal-priority+0,681потребує памʼяті
Життєвий цикл цілей goal-lifecycle+0,681потребує памʼяті
Згасання памʼяті memory-decay-compression+0,587потребує памʼяті
Повернення до сказаного callback-detection0,000дається схемою
Настрій sentiment-tracking0,000дається схемою
Терміновість настрою sentiment-urgency0,000дається схемою
Типи сутностей entity-type-classification0,000дається схемою
Шаблони спостереження scan-pattern-watchlist0,000дається схемою
Вкладання в бюджет токенів token-budget-rendering0,000дається схемою
Порядок переходів temporal-transition-ordering-0,028дається схемою
Типи переходів transition-type-classification-0,056артефакт обрізання бюджету
Машинно розбірний вивід machine-parseable-output-0,215артефакт обрізання бюджету

Стійкість несуча. Вона тримає відстеження цілей, виявлення поворотів теми, накопичені теми й згасання памʼяті. Але стільки ж вимірів даються взагалі без памʼяті: повернення й настрій їдуть в аналізі кожного кроку, а вкладання в бюджет токенів є властивістю формату. Тож частина переваги SAGEN над пласкою памʼяттю походить від можливостей схеми, а не від більшого знання. Два виміри ліворуч від нуля є артефактом обрізання: більше стану проходить крізь ті самі 300 токенів. Це чесне прочитання числа охоплення. Це режим оракула; абляція зі сприйняттям наживо залишається майбутньою роботою.

РОЗКРИТТЯ · ВІДХИЛЕННЯ І ВІДОМІ ПРОГАЛИНИ

4 розкриття

Усе, що вікно зробило інакше, ніж у реєстрації, і кожна прогалина в інструментах. Відкрийте будь-яке.

no-temperature-control

Зареєстровано: Клітинки S2 з температурою 0 і з вибіркою тримаються окремо; стабільність між запусками вимірюється при температурі 0.

Насправді: Поточні рівні Claude API відхиляють явний параметр температури, тож усі запуски йдуть зі стандартною вибіркою кожної моделі, а R = 5 запусків утворюють ОДНУ клітинку на модель.

Зміщення: Робить поріг стабільності H4 СУВОРІШИМ (стандартна вибірка додає шум, який температура 0 придушила б); H4 може провалитися через це відхилення, але не може через нього хибно пройти.

model-ids-pinned-at-window

Зареєстровано: Ідентифікатори моделей заморожено під час реєстрації.

Насправді: Текст реєстрації називає ролі й кількості, але не ідентифікатори моделей постачальника; їх закріпили в цьому зафіксованому файлі до першого оплаченого виклику.

Зміщення: Жодного на результати; прогалина повноти в транскрипції реєстрації, розкрита.

Позначення H4 у таблиці Голма

Таблиця Голма позначає H4 як «відхилити H0» за двобічним бутстреп-p, яке виявляє лише віддаленість від порогу 0,80. Середня узгодженість лежить далеко нижче порогу, тож спрямований зареєстрований критерій провалено: вердикт для H4 - ПРОВАЛЕНА, як показано вище.

Точність реалізації

935 із 960 реалізованих кроків одразу пройшли заморожені перевірки точності. 25 повернулися до зафіксованого замороженого шаблонного тексту після 3 невдалих спроб переписування, і на 7 із них сам шаблон спрацьовує на хибну ознаку повернення. Це прогалина інструмента в списку ознак, а не проблема даних: ці кроки дослівно несуть еталонний текст.

ПЕРЕВІРТЕ САМІ

Не вірте сторінці на слово

Кожне число вище відтворюється з публічного пакета на вашому компʼютері: заморожений корпус, сирий запис кожного оплаченого виклику й інструменти, що їх оцінили. Без облікового запису, без ключа API, без залежностей.

Завантажте пакет і запустіть перевірку (Node 20 або новіший)

B=https://www.jakelawrence.xyz/downloads/sagen-bench/v2; mkdir sagen-bench-v2 && cd sagen-bench-v2 && curl -fsSO $B/SHA256SUMS && awk '{print $2}' SHA256SUMS | xargs -I{} curl -fsS --create-dirs -o {} $B/{} && node verify.mjs

Команда завантажує кожен файл зі списку SHA256SUMS, заново виводить хеш корпусу, решітку, середні охоплення, H1-H4 з бутстреп-інтервалами, родину Голма, контроль суддів і витрати, друкує PASS для кожної перевірки й завершується словом VERIFIED.

ГЛИБШЕ