실패 사례 분석
실패 사례 분석
관찰된 실패 유형
- 메타데이터 불일치로 인한 후보 문서 누락
- 비교 질의에서 한쪽 문서만 상위 노출
- 후속 질문에서 문맥 엔터티 소실
- 근거가 부족한 질문에서 unsupported claim 생성
- claim과 citation chunk가 같은 내용을 직접 지지하지 않는 citation drift
- OCR 누락으로 parser artifact의 본문 text가 retrieval 후보에 들어오지 않는 경우
- layout/section boundary 오류로 heading과 본문이 잘못 묶여 chunk가 노이즈를 포함하는 경우
- table/field 추출 오류로 요구사항 표나 key-value 사실이 누락 또는 오인식되는 경우
- bbox/page-region 누락 또는 오정렬로 citation이 원문 위치까지 설명하지 못하는 경우
대응 전략
- 필터 완화 + 질의 재작성
- top-k/rerank 파라미터 조정
- 세션 컨텍스트 보강 및 검증 로그 점검
- 공개본에서는 agency/project/title metadata를 정규화해 exact/partial/fuzzy 후보를 확장한다.
- 명시적 alias lexicon과 ambiguity clarification 정책은 retrieval-hardening.md에 정리한다.
- verifier가 topic/entity/doc coverage를 확인하고 실패 시 strict → reduced → relaxed 단계로 metadata filter를 완화한다.
- retrieval diagnostics에는 단계별 filter, 후보 수, 검증 실패 사유를 남겨 metadata mismatch를 추적한다.
- 최종 답변은
supported/partial/insufficient상태를 명시하고, claim마다 citation을 연결한다. - 근거가 없으면
claims를 비우고insufficiency에 missing target/topic과 검증 실패 사유를 남긴다. - visual parsing v2는
eval/run_parser_eval.py로 QA 이전 단계의 OCR/layout/section/table/field/bbox 오류를 분리해 기록한다. - page/region citation gold가 있는 경우
eval/run_eval.py가page_missing,page_mismatch,region_unavailable,region_misaligned를 기록한다. - parser failure taxonomy는 downstream 실패와 연결해 해석한다. 예를 들어
ocr_missing_text는 retrieval miss,section_boundary_missing은 noisy chunking,table_cell_mismatch는 표 기반 요구사항 누락,field_value_mismatch는 잘못된 metadata-like claim,bbox_missing/bbox_misaligned는region_unavailable/region_misaligned로 이어질 수 있다.
자세한 real-data 분석과 우선순위 백로그는 real-data-failure-taxonomy.md 참조.