Переосмысление тоже требует доказательств
68 зелёных технических тестов не исключили ошибку: дополнительный аудит показал, что функция могла менять вывод на основании отзыва, чьи собственные предпосылки уже недействительны.
Что проверяем вместо красивого ответа
К исполнению, критическому переосмыслению, расширению перспектив («медитации») и интегральному синтезу добавлен проект протокола работы с историей доказательств. Это внешние процедуры, а не подтверждённые внутренние состояния модели.
Время разделяется на событие, доступность записи и срок её применимости. Пространство в прототипе — система, среда, версия и регион. Результат теста для одной версии не переносится молча на другую; позднее свидетельство не попадает в прежний срез.
Контрпример: у пересмотра тоже есть основания
Положительный отчёт поддерживает вывод. Позже приходит условный отзыв со ссылкой на диагностическое основание. К моменту запроса основание просрочено, но исходная функция всё равно применяет отзыв и возвращает UNKNOWN.
Причина видна в коде: проверялись источник, контекст и срок отзыва, но пропускались его derived_from. Кандидат проверяет эти зависимости и сохраняет SUPPORTED при недействительном условном отзыве — строго внутри объявленной учебной политики.
Недостаточно проверить новый вывод. Нужно проверить, на каком основании система решила изменить прежний.
Это не правило восстановления реальных разрешений. Безусловный административный отзыв проверен отдельно и сохраняет действие. Ни один статус этого прототипа не разрешает платёж, релиз или иное внешнее действие.
Измеренные промежуточные результаты
| Проверка | Результат | Что это означает |
|---|---|---|
| Исходный набор / кандидат на том же наборе | 68/68 · 68/68 | Повторные локальные технические проверки, не независимые выборки. |
| Прежние контрольные срезы | 36/36 без изменений | Совместимость с исходными учебными историями. |
| Новые граничные случаи | 7/12 → 12/12 | Четыре варианта одной ошибки и отдельная граница циклического обоснования. |
| Перестановки записей кандидата | 600 проверок прошли | 50 seeded-перестановок на случай; это не 600 независимых задач. |
| Добавление будущей записи | 24 проверки прошли | Исторический вход не изменился в двух форматах. |
| LLM / независимая оценка | 0 / 0 | Рейтинга протоколов пока нет. |
У кандидата циклическое обоснование явно отклоняется, а не «решается». Этот дополнительный выбор политики не выдаётся за исправление ранее доказанной гарантии. Все ожидания и случаи созданы тем же исследовательским процессом; проценты обобщённой точности по ним не оцениваются.
Код, воспроизводимый аудит и результаты →
Полный методический отчёт и история уточнений →
Что ещё не доказано
Нет внешнего корпуса, закрытого holdout, независимой репликации, проверки истинности источников или готовности к промышленному применению. Хеш подтверждает совпадение байтов с зафиксированным значением, но не правдивость сообщения. Количество копий отчёта не превращает их в независимые проверки.
Следующий эксперимент должен сравнить R4 и R5, каждый с плоским журналом и графом с одинаковой информацией, при зафиксированном общем бюджете и оценивании без названий режимов. Основной вопрос — частота критических ошибок и ложных пересмотров, а не убедительность текста.
Контекст исследования
W3C PROV-DM описывает происхождение и производные сущности; Zep исследует временную графовую память; LongMemEval оценивает в том числе временное рассуждение и обновление знаний. Их результаты не являются результатами нашего кода. Сам временной граф не объявляется новым изобретением проекта.
Раскрытие: автор тестов, кандидат исправления и интерпретация не независимы. Публикация в собственном журнале проекта не является внешним одобрением.