연구진은 AI 시스템이 스스로 수정되는 기록에서 정보를 검색하는 문제를 다루고 있습니다. 관련 증거를 찾는 것뿐 아니라, 어떤 주장이 유효하고, 언제 효력을 잃었는지 판단하는 것이 중요합니다. 구조화된 메모리가 유형 에지, 시간 업데이트, 충돌 상태를 통해 이 문제를 해결할 수 있다고 약속하지만, 평가 시 메커니즘과 프롬프트 표현을 함께 변경하는 경우가 많습니다.
GitHub, Wikipedia, DyKnow 스타일의 시간 흐름에서 2,907개의 질문을 사용하여 평탄 검색, 조잡한 에지 무효화, 세밀한 RevisionLedger를 비교한 결과, 표현 방식을 통제한 결과 RevisionLedger는 평탄 기준을 +0.182만큼 능가했지만, 대부분의 성능 향상은 더 쉬운 표현 덕분이었고, 세밀한 메커니즘의 잔여 성능은 거의 차이가 없었습니다.
연구 결과, 메모리 평가는 표현 방식을 고정해야 하며, 폐기 정보를 인지하는 시스템은 쿼리를 커버하는 가장 조잡한 유지 상태를 배포해야 합니다.