LLMOps Platform

LLMOps & AI 엔터프라이즈 플랫폼

로컬 LLM(Ollama)과 클라우드 LLM(Claude)을 폐쇄망에서 안전하게 운영합니다. 모델 무중단 교체, 구성요소 관제, 오프라인 배포까지 — 자체 개발한 Private RAG 플랫폼 Bailey RAG에 실제 구현된 LLM 운영 체계를 제공합니다.

Hot-swap
모델 무중단 교체
Local + Cloud
Ollama · Claude 백엔드
Offline
폐쇄망 오프라인 배포
거버넌스
등급 · 차단 · 감사
Bailey RAG · LLM Operations

핵심 운영 기능

모델 무중단 교체부터 구성요소 관제 · 모니터링 · 런타임 튜닝까지 — Bailey RAG에 실제 구현된 폐쇄망 LLM 운영 기능입니다.

01

⚡ 모델 Hot-swap (무중단 교체)

Preload(모델 확인) → Warmup(메모리 예열) → Switch(기본 모델 전환) → Drain(진행 요청 정리) 4단계로 기본 모델을 무중단 교체합니다. 각 질의가 자체 모델을 지정하므로 진행 중 작업이 끊기지 않으며, 예열 시간·소요 시간과 교체 이력이 감사 로그에 기록됩니다.

02

🧠 모델 관리 (Ollama)

설치된 모델 목록을 파라미터 크기 · 양자화 · 용량 · 메모리 로드 상태(로드됨/대기)와 함께 관리합니다. Ollama 연결 상태와 총 모델 수 · 총 용량을 확인하고, 질의별로 사용할 모델을 지정합니다.

03

🔀 멀티 백엔드 거버넌스

기본은 로컬 Ollama, 옵션으로 클라우드 Claude를 함께 운영합니다. 대외비 등급 근거는 외부 클라우드 LLM으로 전송되기 전에 자동 차단되고, 외부 연계(MCP·클라우드)만 DMZ로 분리되어 폐쇄망 보안을 유지합니다.

04

🛠️ 구성요소 관제

postgres · redis · api · worker · ollama 등 컨테이너 구성요소의 상태 · 역할 · 포트를 한 화면에서 보고, 시작 / 정지 / 재시작을 제어합니다. 구성요소별 실시간 컨테이너 로그를 스트리밍으로 확인합니다.

05

📊 운영 모니터링

자원(LLM) · 실행 작업 큐(Redis + RQ) · 평균 tok/s · 평균 응답 시간(초) · 활성 세션 · 로컬 처리율을 통합 대시보드로 추적합니다. 지식베이스 · 거버넌스 · RAG 핵심 지표를 한눈에 관제합니다.

06

🎚️ 런타임 튜닝 & 평가

검색 융합(벡터 · BM25 가중치 · RRF k) · 생성(temperature · 최대 토큰) · 청킹(크기 · 오버랩 · top-k) · 시스템 프롬프트를 화면에서 실시간 조정하고 DB에 저장합니다. 답변 만족도 피드백과 리랭커(bge-reranker) A/B 비교로 품질을 개선합니다.

Technology Stack

기술 스택

Bailey RAG가 실제로 사용하는 폐쇄망 LLM 운영 스택.

A

모델 · 추론

로컬 LLM 런타임은 Ollama, 임베딩은 bge-m3(1024차원), 재순위는 bge-reranker를 사용합니다. 기본 LLM은 qwen2.5 계열이며 옵션으로 Claude API를 연동합니다.

Ollamabge-m3bge-rerankerClaude API
B

데이터 · 인프라

벡터 · 문서 · 감사 로그는 PostgreSQL + pgvector(HNSW)에 저장하고, 비동기 인덱싱 작업은 Redis + RQ 워커로 처리합니다. API는 FastAPI로 제공합니다.

PostgreSQL · pgvectorRedis · RQFastAPI
C

배포

Docker Compose 멀티스테이지로 전체 스택을 한 번에 기동하고, 오프라인 번들(.tar · docker save)과 OS별 설치 스크립트로 폐쇄망에 100% 로컬 설치합니다. Kubernetes와 Electron 데스크톱 앱 배포도 지원합니다.

Docker ComposeKubernetesOffline BundleElectron

LLM 도입을
고민하고 계신가요?

30분 무료 컨설팅으로 귀사에 맞는 LLM 전략을 제안해 드립니다.