문서 한 건이 파이프라인을 지나는 과정을
단계별로 투명하게 — DocPipeline

문서 첨부 또는 게시물 URL을 넣으면 파싱 → 청킹 → 임베딩 → 인덱싱 → LLM 개요까지 자동 처리하고, 각 단계의 중간 산출물을 결과 상세 화면에서 그대로 확인합니다. 관리자는 같은 화면에서 검수·개입·재실행과 품질 평가까지 이어갑니다.

DOC · DOCX · HWP · HWPX · JPEG · JPG · PDF · PNG · PPT · PPTX · TXT · XLS · XLSX  ·  최대 10개 × 50MB  ·  게시물 URL 1개

현재 구성

HWP / HWPX 파싱
kordoc
한글 전용 파싱 체인 (텍스트 없으면 OCR 폴백)
OCR 엔진 체인
paddleocrtesseract
이미지·스캔 PDF 교차 검증, 혼합형 PDF는 페이지별 OCR, 엔진 강제 지정 가능
임베딩 → 벡터DB
upskyy/bge-m3-koreanChromaDB
청크 단위 인덱싱 · 결과 상세에서 유사 청크·검색 테스트
LLM 개요 모델
ollama:gemma4:12b-mlx
1개 모델 병렬 분석 → 모델별 탭으로 비교

파이프라인 단계

0
입력
파일 첨부 또는 게시물 URL(본문·첨부 자동 수집) · S2S API · 수집 소스
1
파싱
kordoc · 네이티브 추출 · OCR 엔진 체인 — 엔진별 결과·선택 근거 기록
2
청킹
의미 단위 분할, 청크 목록·메타 조회
3
임베딩
upskyy/bge-m3-korean 벡터화 · 유사 청크 탐색
4
인덱싱
ChromaDB 적재 · 요청 범위 검색 테스트
5
LLM 분석
구조화 개요 JSON — 문서 유형 · 핵심 내용 · 주요 기술 · 일정 · 준비사항 · MSP 전환 관련성 · 파일별 요약

각 단계는 소요 시간·엔진·모델이 계측되어 분석 화면의 진행 스테퍼와 결과 상세, 관리자 구성도에 표시됩니다.

사용자 화면

📑
분석 요청 /analyze
파일 첨부 또는 URL 하나로 제출
드래그앤드롭 첨부(최대 10개) 또는 게시물 URL 입력 → 단계별 진행 스테퍼로 실시간 추적, 처리 중 취소, 완료 시 결과 상세로 이동.
🗂
내 분석 이력 /requests
제출한 요청의 상태·결과 한눈에
PENDING · PROCESSING · DONE · FAILED 상태별 목록, 요청별 상세 진입.
🔍
결과 상세 /requests/{id}
7개 탭으로 중간 산출물 전부 공개
요약 · 원본 보기(페이지 이미지) · 파싱 전문(엔진별) · 청킹 · 임베딩(유사 청크) · 인덱싱(검색) · LLM 분석(모델별 탭), Markdown 보고서 다운로드.
🔌
S2S API · CLI
X-API-Key 인증, 터미널에서 원스톱
/api/v1/parse 파싱, /api/v1/analyze RAG 질의, /api/v1/analysis/requests 제출·폴링·보고서 — scripts/docpipe.sh, 원격 vs Claude/Codex CLI 비교 평가용 agent CLI.

관리자 · 운영 /admin · 관리자 권한

📊
파이프라인 이력 · 구성도 · 집계
전체 요청 이력, 행 클릭 시 단계별 구성도, 엔진·모델별 운영 지표 위젯.
🕸
consumer ×8 의 LLM 처리 흐름(최근 30일) · consumer 사용량 · 골든셋 큐레이션 · 비교 실험 이력 — LLMOps 에서 pull (2026-09-12 이관).
🌐
수집 소스
로컬 · NAS · 웹 크롤 · PubMed 커넥터 — 증분 수집, 스케줄러, 연결 테스트, config/sources.yaml 동기화.
🛠
검수 콘솔 · 재실행
결과 상세 관리자 모드 — 단계별 개입(override), 정답(golden) 등록, 원하는 단계부터 재실행, revision diff.
🧪
파싱 품질 채점
층화 샘플 배치 → LLM 채점 · CLI 교차 채점 · 심판 간 일치도, 재파싱 큐 등록.
📦
정답 데이터셋 export
검수 콘솔에서 저장한 golden → JSONL (문서 내용 포함, 반출은 private 저장소로).
🎯
평가 대상 어댑터
자체 RAG · AllergyInsight · 범용 HTTP 질의응답 케이스 등록·실행·채점.
🔁
운영 평가 자동화
섀도우 평가, 프롬프트·모델 변경 감지 재평가 트리거, Golden Set 회귀, LLMOps 라운드 등록.
🧠
학습 환경 · 이력
임베딩 미세조정 → 구조화 SFT 이력 조회 (실행은 호스트 python -m training run, cuda/mlx/cpu/remote).