AI Engineer
손성준
LLM Serving · AI Search · MCP Agents · DevOps
LLM 서빙, AI 검색엔진, RAG, MCP 에이전트, Kubernetes 인프라를 다루는 기술 블로그입니다. 커머스 검색엔진에서 출발해 AI 에이전트 플랫폼(XGEN)까지, 실전에서 직접 만들고 운영한 경험을 기록합니다.
Topics
관심사별로 바로 읽기
Featured
- AI
graph-tool-call: LLM Agent를 위한 그래프 기반 도구 검색 엔진
1,077개 API endpoint를 가진 커머스 플랫폼에서 LLM Agent가 적절한 도구를 찾는 문제를 해결하기 위해 그래프 기반 도구 검색 엔진을 설계하고 구현한 과정을 정리한다. OpenAPI 스펙 자동 수집, 관계 그래프 구축, BM25+그래프확장+임베딩 하이브리드 검색, MCP Annotation-Aware Retrieval까지 8일간의 개발 여정을 다룬다.
LLM AgentTool Retrieval - AI
vLLM에서 llama.cpp로: LLM 서빙 아키텍처 통합 마이그레이션
vLLM Ray Serve 분산 구조에서 통합 모델 서빙 서비스로 마이그레이션한 과정. 백엔드 스위칭 매니저 설계, llama.cpp와 vLLM 런타임 전환까지.
모델서빙리팩토링 - Search
Rust로 커머스 검색 엔진을 처음부터 만들기
NestJS 기반 검색 서비스의 한계를 넘어, Rust로 이커머스 검색 엔진을 처음부터 설계하고 구현한 과정을 다룬다.
Rust검색엔진
Recent Posts
보험 광고 영상을 AI로 검사하기: OCR, STT, RAG, 객체 탐지를 묶은 심의 QA 파이프라인
수정일:보험 광고 영상의 필수 고지, 음성 안내, 금지표현, 금지 이미지, 자막 위치 요건을 OCR, STT, RAG, 객체 탐지, LLM 판정으로 자동 점검한 POC 과정을 정리한다.
graph-tool-call v0.36: LLM이 필요한 도구를 안전하게 고르게 만들기
LLM 에이전트가 수백 개 API 도구 중 필요한 도구를 고르고, 선행 호출을 안전하게 붙이고, 그 근거를 재현 가능한 실험 파일로 남긴 과정을 정리한다.
텍스트가 안 뽑히는 PDF를 에이전트가 읽게 만드는 법
XGEN Agent 파일 처리에서 스캔 PDF를 fast pre-scan으로 판별하고, 페이지 렌더링과 VLM fallback으로 텍스트 레이어가 없는 문서까지 읽게 만든 과정을 정리한다.
884만 문서에서 알게 된 것: 검색보다 어려운 건 검색을 시키는 일
synaptic-memory를 884만 MS MARCO passage 위에서 평가하며, 검색 정확도보다 agent loop의 도구 선택, query rewrite, 증거 누적, 실패 기억이 더 큰 병목으로 드러난 과정을 정리한다.