저장에서 회수로,
회수에서 검증으로
2·3·4주차의 원문 기반 사례 95편을 횡단 분석해 AKM의 공통 메시지, 실패 패턴, 성숙도와 현재 시스템 적용 우선순위를 정리했습니다.
핵심 메시지
주차별 관심의 중심 이동
구조→운영→평가의 인과적 계단이 아니라, 사례에서 반복적으로 나타난 중심 질문의 변화입니다.
구조와 경계
- Source·Knowledge·Context·Memory·Procedure 구분
- 기존 시스템을 AKM에 매핑하고 최소 침습 이식
- 메모리 과적재와 낡은 정본 발견
- 폴더보다 층위와 책임을 재정의
작동과 게이트
- inbox, reuse-first, 승격 게이트
- dry-run과 사람 승인 경계
- 입력 경로가 없는 빈 레인 발견
- 자동 PASS와 의미 검증의 분리
측정과 안전
- 정확도와 도달률을 별도 측정
- CURRENT·HISTORICAL·HOLD 상태
- 맞는 답과 틀린 근거 발견
- silent fallback과 검색 진입점 검사
10가지 종합 인사이트
95개 사례에서 반복된 신호를 AKM의 재사용 가능한 운영 원칙으로 바꿨습니다.
저장과 작동은 다르다
파일이 존재해도 에이전트가 찾지 못하면 운영상 없는 지식입니다. 정확도 88%와 도달률 49%의 격차, 99.25점 구조에서 발생한 검색 누락이 이를 보여줍니다.
저장 성공과 회수 성공을 별도 판정대표 근거
정답과 근거는 별개다
정답 문서를 읽지 않아도 맞는 문장을 만들 수 있습니다. 답변 내용, 실제 회수, 주장 지지를 세 지표로 분리해야 합니다.
answer correctness ≠ source support대표 근거
폴더보다 경로를 설계한다
레이어가 있어도 자료가 들어오지 않거나, 기존 지식을 검색하지 않거나, 승격 기준이 없으면 운영은 시작되지 않습니다.
source → promote/HOLD → retrieve → verify대표 근거
Memory는 포인터다
긴 본문과 빨리 낡는 진행 상태는 세션 메모리를 오염시킵니다. 짧은 회수 낚싯바늘과 정본의 분리가 필요합니다.
thin memory, thick knowledge대표 근거
신선도·범위·권위도 지식이다
과거에는 맞았던 문서를 지금도 맞는 것처럼 읽으면 사고가 납니다. 존재 여부와 현재 사용 허가를 분리해야 합니다.
CURRENT · HISTORICAL · HOLD대표 근거
게이트도 검증 대상이다
실행 게이트는 수동 규칙보다 강하지만, 잘못된 범위를 재거나 fallback을 숨기면 거짓 PASS를 만듭니다.
test the tester대표 근거
판단보다 검사와 기록을 자동화한다
수집·중복 탐지·회귀검사·후보 생성은 자동화하고, 공개·삭제·정본 승격·법적 판단은 사람 승인과 롤백 경계를 둡니다.
automation checks, humans approve대표 근거
Learn Back은 실행 자산을 바꾼다
회고문이 아니라 procedure, gate, schema, checklist, evaluation이 실제로 바뀌어야 다음 실행이 달라집니다.
기록보다 미래 실행의 변화대표 근거
실행 공간과 지식 정본을 분리한다
분리만 하면 지식이 쓰이지 않습니다. adapter, pointer, command, task contract라는 명시적 다리가 필요합니다.
separate custody, explicit bridge대표 근거
성과는 재사용과 실행 변화다
파일 수는 성과가 아닙니다. 실제 회수율, 재사용률, 실패 재발 감소, 새 조사 없이 만든 결과를 측정해야 합니다.
count outcomes, not files대표 근거
반복 실패 패턴과 대응
| 실패 패턴 | 증상 | 구조적 원인 | 탐지 신호 | 대응 |
|---|---|---|---|---|
| 저장됐지만 미회수 | 노트는 많은데 답변에서 사용되지 않음 | read path·index·ingest·파일명 경계 부재 | 읽은 파일 목록, 도달률, 자기회수 | read-before-answer, reuse-first, 진입점 회귀시험 |
| 맞는 답·틀린 근거 | 정답률은 높지만 엉뚱한 문서를 사용 | 내용 점수만 있고 출처 지지 점수 없음 | intended source mismatch | claim-level source support, direct read |
| silent fallback | 오류 없이 정상처럼 완료 | timeout·fallback이 상태로 노출되지 않음 | fallback_used, reviewer trace 누락 | fail closed, PASS_WITH_NOTE, NOT_TESTED |
| 오래된 지식 사용 | 구판과 신판이 함께 현재 근거로 검색 | validity·authority·supersession 부재 | stale list, version diff | CURRENT/HISTORICAL/HOLD와 연결 보존 |
| 맥락 오염 | 다른 프로젝트·고객·계통 정보가 섞임 | scope·lineage·workspace 경계가 암묵적 | 무관 질문, contamination flag | task contract, scope manifest, hard gate |
| 자동화 과잉 | AI가 사용자 이해와 승인보다 앞서감 | 쓰기 권한이 계약보다 먼저 열림 | dry-run과 실제 변경 차이 | dry-run 기본, batch limit, 명시 승인 |
| 오해를 부르는 지표 | 99점·PASS·파일 수가 성공처럼 보임 | 단일 총점이 회수·근거·효과를 숨김 | accuracy/reach 분리, baseline | 과정·결과 쌍 측정, metric dictionary |
| 고장 난 검사기 | lint 0인데 의미는 틀림 | negative fixture와 의미 검사가 없음 | 틀린 입력도 PASS | seeded failure, evaluator self-test |
| 운영 기록 누락 | 사고는 커밋·채팅에만 남음 | 기록이 작업 후 별도 의무 | fix/revert와 ERRORS 대조 | 기존 흐름에서 기록 후보 자동 생성 |
AKM 성숙도 L0부터 L5
폴더 수가 아니라 가장 약한 통과 질문으로 성숙도를 판정합니다.
보관
원본과 정본을 식별할 수 있는가?
구조화
Source·Knowledge·Context·Procedure를 구분하는가?
회수 가능
새 세션이 의도한 지식을 실제로 찾고 읽는가?
검증 가능
어떤 근거로 어디까지 행동했는지 설명 가능한가?
학습 가능
실패가 다음 실행 규칙을 바꾸는가?
회복 가능
변경 후 회수·근거·범위·성능이 유지되는가?
현재 마스터 AKM과의 대조
사례들이 요구한 안전 원칙의 상당수는 이미 구현되어 있습니다. 다음 단계는 구조 추가보다 실사용 계측입니다.
현재 AKM 적용 우선순위
Read-Path 평가팩
- 실제 작업 질문 15개
- AKM root와 프로젝트 세션 비교
- 읽은 파일·direct read·source ID 기록
- 정확도·도달률·근거지지 분리
- 무관 질문으로 오염 측정
Knowledge Return
- Reused: 실제 사용한 기존 지식
- Modified: 바뀐 판단
- Added: 새 검증 지식
- Held: 미확정·충돌
- Targets: 갱신할 실제 경로
fallback 가시화
- timeout·reviewer skip 상태화
- stale index·partial read 노출
- negative fixture 없는 검사기는 NOT_TESTED
- 같은 세션의 작성·검증 표시
지식 사용 상태
- CURRENT·HISTORICAL·HOLD
- LEARN·REJECT
- as_of·last_verified·authority
- 전역 스키마 전 한 도메인 파일럿
reuse / extend / new
- 조사 전 기존 자산 검색
- 선택과 이유 기록
- exact·qmd·direct read 결합
- 예상 target note 명시
그래프와 대규모 자동화
- cutoff에서 근거가 반복 탈락할 때
- 관계 탐색이 필수일 때
- 파일 병합 충돌이 비용을 넘을 때
- read-path 실패가 재현될 때만
claimSupportedAccuracy = 근거가 주장을 지지하며 정답인 응답 / 평가 응답
sourceLineageRecovery = 올바른 원본·정본까지 추적 가능한 응답 / 근거 사용 응답
silentFallbackRate = fallback이 발생했지만 정상처럼 처리된 응답 / 평가 응답
contaminationRate = 범위 밖 지식이 섞인 응답 / 평가 응답
30일 강화 실험
질문과 근거 동결
세 개 실제 도메인에서 질문 15개와 의도 근거를 정하고, gold 노출 없이 checksum을 고정합니다.
baseline 측정
AKM 세션과 프로젝트 세션에서 정확도·도달률·근거지지·오염·fallback을 분리합니다.
상태와 환류 파일럿
한 도메인에서 freshness 상태와 Knowledge Return을 실제 작업 종료에 연결합니다.
회귀와 판정
같은 질문으로 reach·lineage 개선, 정답률 no-degradation, token·latency 예산을 비교합니다.
승격·HOLD·롤백 기준
승격
- 의도 근거가 반복 회수됨
- 주장과 직접 읽은 근거가 연결됨
- scope·freshness·authority 설명 가능
- 사람 승인과 자동 PASS가 분리됨
- 회귀시험에서 no-degradation
HOLD
- 출처 또는 직접 읽기 없음
- 맞는 답이지만 의도 근거 미회수
- 충돌·신선도·범위 미해결
- 같은 AI가 작성과 검증을 모두 수행
- 검사기가 실패 입력을 잡는지 미확인
중단·롤백
- 정답률 상승과 source support 하락
- 회수율과 무관 지식 오염이 함께 증가
- token·latency 예산 초과
- fallback이 실패를 성공으로 숨김
- 정본·파생 인덱스 불일치 미복구
피해야 할 안티패턴
AKM은 지식 창고가 아니라 지식 운영 제어계다
이미 가진 시스템을 측정하고, 원본·해석·맥락·절차·평가의 책임을 나누고, 저장보다 입력과 회수 경로를 설계해야 합니다. 판단을 자동화하기 전에 검사와 기록을 자동화하고, PASS가 증명하지 않는 것까지 명시해야 합니다.