Pipeline 핵심 기능 파서 템플릿 접근 제어 검색 엔진 엔터프라이즈
Knowledge Management Platform

문서에서 지식으로,
지능형 검색 파이프라인

HWP, PDF, DOCX, 웹페이지 등 모든 형태의 문서를 업로드하면
자동 파싱 → 지능형 청킹 → 벡터 임베딩 → 하이브리드 검색까지
엔드투엔드 지식 관리 파이프라인이 완성됩니다.

Knowledge Pipeline — Processing
12 PARSERS HYBRID SEARCH
Upload
report.pdf
Parse
Paper Template
Chunk
512 tokens
Embed
1536-dim
Index
Hybrid Store
Core Technology

지식 검색의 핵심 기술

문서 수집부터 검색, 품질 평가까지 — AI 지식 관리의 모든 단계를 커버하는 네 가지 핵심 엔진입니다.

하이브리드 검색

키워드 + 시맨틱
하이브리드 검색 엔진

키워드 매칭과 벡터 시맨틱 검색을 결합하여 최적의 검색 결과를 제공합니다. 가중치 조절로 검색 특성을 세밀하게 튜닝하고, 다단계 Re-Ranking으로 정확도를 극대화합니다.

  • 키워드(5%) + 벡터(95%) 기본 가중치, 서비스별 자유 조절
  • 다단계 Re-Ranking — 토큰/벡터/모델 기반 정밀 재정렬
  • 목차(ToC) 기반 컨텍스트 확장 및 하위 청크 병합
"의료 AI 규제 가이드라인"
5%
Keyword
95%
Semantic
DOC-1842 · p.230.94
의료 AI 서비스에 대한 규제 프레임워크는 환자 안전성을 최우선으로...
DOC-0921 · p.70.89
AI 기본법 시행령에 따른 고위험 AI 시스템 분류 가이드라인...
DOC-3104 · p.510.82
디지털 헬스케어 관련 규제 샌드박스 적용 사례 분석...
지능형 파싱

12+ 문서 파서 템플릿 &
구조 인식 청킹

논문, 법률 문서, 매뉴얼, 발표 자료 등 문서 유형별 최적화된 파서 템플릿으로 문서 구조를 정확히 인식합니다. OCR, 테이블 추출, 하이퍼링크 분석까지 지원합니다.

  • 12종 특화 템플릿 — 논문/법률/매뉴얼/Q&A/발표자료 등
  • 비전 기반 레이아웃 인식 — 테이블, 그림, 수식 자동 추출
  • 청크 크기, 오버랩, 페이지 그룹핑 등 세밀한 파라미터 제어
medical-ai-research.pdf
42 pages · 2.8 MB
↓ Auto-detect: Paper Template ↓
Parser Configuration
Paper Template
chunk: 512 tokens overlap: 64 layout: ON OCR: ON table: extract
#1Abstract: 본 연구는 의료 AI 시스템의 규제 프레임워크...487t
#21. Introduction: 최근 디지털 헬스케어 산업의 급성장...512t
#32. Related Work: 기존 규제 체계의 한계점을 분석...498t
#4[TABLE] Table 2: 국가별 AI 의료기기 인허가 현황...256t
지식 그래프

GraphRAG &
엔티티 관계 추출

문서에서 개체(Entity)와 관계(Relation)를 자동 추출하여 지식 그래프를 구축합니다. 단순 텍스트 검색을 넘어 멀티홉 관계 추론과 커뮤니티 기반 토픽 클러스터링을 지원합니다.

  • 자동 엔티티 추출 — 인물, 조직, 지역, 개념 등 분류
  • 멀티홉 관계 탐색 — 직접 연결되지 않은 지식 간 연결 발견
  • 커뮤니티 탐지 — 의미적으로 밀접한 엔티티 클러스터링
품질 평가

RAG 평가 프레임워크 &
자동 품질 측정

테스트 데이터셋을 구성하고 검색 정확도, 응답 품질, 인용 정확도를 자동으로 측정합니다. 설정 변경 전후를 비교하여 최적의 검색 파라미터를 찾을 수 있습니다.

  • 테스트 케이스 관리 — 질문-정답 쌍, 관련 청크 연결
  • Precision/Recall 자동 측정 — 검색 성능 정량 평가
  • 다중 런 비교 — 설정 변경 전후 성능 비교 분석
Evaluation Results Run #12
Precision
91%
Recall
87%
Citation Acc.
94%
Answer Qual.
88%
"AI 의료기기 인허가 절차는?"PASS
"고위험 AI 분류 기준"PASS
"규제 샌드박스 신청 방법"PARTIAL
Parser Templates

12종 문서 파서 템플릿

문서 유형에 최적화된 파서 템플릿으로 구조를 정확히 인식합니다. 챕터, 조항, 질답, 슬라이드 등 문서 특성에 맞는 지능형 청킹을 제공합니다.

General
범용 문서. 문장/단락 구분자 기반 청킹
PDFDOCXTXTMD
Paper
학술 논문. 섹션/참고문헌 구조 인식
PDFDOCX
Book
도서/이북. 챕터/섹션 계층 구조 인식
PDFDOCXTXT
Law
법률 문서. 조/항/호 구조 기반 청킹
PDFHTML
Regulations
내부 규정/정책. 계층적 구조 인식
PDFDOCX
Manual
매뉴얼/가이드. 단계별 절차 인식
PDFDOCXMD
Q&A
FAQ 문서. 질문-답변 쌍 자동 인식
DOCXTXTXLSX
Table
스프레드시트/구조화 데이터. 행 단위 추출
XLSXCSV
Presentation
발표 자료. 슬라이드 단위 청킹
PPTPPTXPDF
One
단일 청크 모드. 문서 전체를 하나로
ALL
Tag Set
태그 사전. 행 기반 태그 추출 및 자동 태깅
XLSXCSV
Resume
이력서/CV. 연락처, 경력, 학력 구조 추출
PDFDOCX
HWP
PDF
DOCX
XLSX
PPTX
TXT
MD
HTML
JSON
WEBCrawl
Data Governance

지식 데이터 접근 제어 & 상세 분석

지식 데이터에 대한 다층 접근 제어로 민감 정보를 보호하고, 문서 처리 결과를 6개 전용 뷰에서 상세하게 검증합니다.

다층 접근 제어
테넌트 → 역할 → 부서 → 지식베이스 권한까지 4단계 보호
테넌트 격리
모든 지식 데이터는 테넌트 단위로 완전 격리. 다른 조직의 데이터에 접근 불가
tenant_id
역할 기반 접근
Owner, Admin, Member 등 역할별 지식베이스 관리 권한 차등 부여
RBAC
부서 기반 공유
사용자는 복수 부서에 소속 가능. 부서 단위로 지식 접근 범위를 세분화
dept_ids
지식베이스 권한
나만 보기 — 생성자만 접근  |  전체 팀원 — 팀 전체 공유
me / team
이중 인증 지원
사용자 JWT 토큰 또는 서비스 API Key — 두 가지 인증 경로 지원
JWT / API Key
문서 상세 분석 뷰
6개 전용 탭에서 처리 결과를 깊이 있게 검증하고 관리합니다
처리 진행률
세그먼트 목록
문서 분할
청크 검증
임베딩 시각화
비교
Upload
100%
Parse
100%
Chunk
100%
Embed
72%
Index
Embedding 612/847 chunks — ETA 4.2s
#001Abstract: 본 연구는 의료 AI 시스템의 규제 프레임워크를 분석하여...3 keywords
#0021. Introduction: 최근 디지털 헬스케어 산업의 급성장과 함께...5 keywords
#0032. Related Work: 기존 AI 규제 체계의 한계점을 분석하고...4 keywords
#004[TABLE] Table 2: 국가별 AI 의료기기 인허가 현황 비교표...2 keywords
#0053. Methodology: 규제 영향도 평가를 위한 정량적 분석 방법론...6 keywords
847 segments · 키워드 편집, 활성/비활성 토글, 일괄 작업 지원
원본 문서
Abstract: 본 연구는...
1. Introduction: 최근...
2. Related Work: 기존...
청크 분할 결과
Chunk #1 · 487t
Chunk #2 · 512t
Chunk #3 · 498t
원본과 청크를 나란히 비교 · 색상 매핑으로 분할 경계 시각화
"AI 의료기기 인허가 절차는?"HIT · 0.94
"고위험 AI 분류 기준"HIT · 0.89
"규제 샌드박스 신청 방법"PARTIAL · 0.71
"임상시험 데이터 요건"MISS · 0.32
질문별 검색 적중률 검증 · 청크 품질 분석 및 개선 포인트 도출
PCA 2D Projection
847 chunks · 1536-dim → 2D · 벡터 공간에서 청크 분포 시각화
Run #11 (v3.1)
vs
Run #12 (v3.2)
Chunks812847 (+35)
Avg Tokens501487 (-14)
Tables1218 (+6)
Duration15.1s12.4s (-2.7s)
파이프라인 실행 간 비교 · 설정 변경 효과를 정량적으로 분석
Processing Engine

문서 처리 & 검색 엔진

문서 수집부터 벡터 인덱싱, 검색 후처리까지 — 각 단계를 독립 모듈로 구성하여 유연하게 파이프라인을 조합합니다.

문서 처리 (Ingestion)
문서 업로드 & 웹 크롤링
드래그앤드롭 파일 업로드, Jina/FireCrawl 기반 웹 크롤링, MIME 자동 감지
레이아웃 인식 & OCR
비전 기반 레이아웃 분석, 스캔 PDF OCR, 테이블/그림 자동 추출
구조 인식 청킹
템플릿 기반 지능형 분할, 토큰 크기/오버랩/페이지 그룹핑 제어
청크 보강
자동 키워드 추출(한국어 형태소 분석), 질문 생성, 목차 태깅
검색 엔진 (Retrieval)
하이브리드 퓨전 검색
키워드 + 시맨틱 벡터 결합, 가중치 조절, 메타데이터 필터링
다단계 Re-Ranking
토큰/벡터/모델 기반 재정렬, 유사도 임계값 필터링
컨텍스트 확장
ToC 기반 관련 섹션 확장, 하위 청크 병합, 인접 컨텍스트 추가
컨텍스트 압축
Truncate/Extractive/Abstractive 3단계 압축, 토큰 제한 자동 맞춤
Enterprise Features

엔터프라이즈 지식 관리

대규모 문서 관리와 조직 단위 지식 운영에 필요한 모든 기능을 갖추고 있습니다.

임베딩 시각화
PCA 기반 2D/3D 벡터 공간 시각화. 청크 분포를 시각적으로 확인하고 검색 품질을 직관적으로 분석합니다.
메타데이터 필터링
커스텀 메타데이터 스키마 정의 및 AND/OR 조건 기반 검색 필터링. 문서 출처, 날짜, 부서 등으로 정밀 검색합니다.
인용 소스 추적
AI 응답에 사용된 청크를 자동 추적하고 원본 문서와 페이지를 정확히 인용합니다.
실시간 파이프라인 모니터링
문서 처리 진행률, 단계별 상태, 워커 건강 상태를 실시간 스트리밍으로 모니터링합니다.
청크 단위 관리
개별 청크 내용 수정, 키워드 편집, 활성/비활성 토글, 일괄 작업 지원. 수정 시 벡터 자동 재생성.
웹 크롤링 통합
URL 기반 웹페이지 자동 수집. 메인 콘텐츠 추출, HTML 파싱, 주기적 업데이트를 지원합니다.
Start Today

조직의 모든 지식을,
AI가 찾아드립니다

수천 건의 문서에서 필요한 정보를 몇 초 만에 찾아주는
지능형 지식 검색 파이프라인을 구축하세요.