태그: GPU
이 태그가 달린 글 "GPU".
vLLM + llama.cpp GPU 모델 서빙 최적화 실전기
대규모 언어 모델의 효율적인 서빙을 위해 vLLM과 llama.cpp 기반 추론 엔진을 구축한 과정. GPU 리소스 최적화, 동적 배칭, CUDA 메모리 관리까지 프로덕션 경험을 정리한다.
Vast.ai GPU 인스턴스 관리 API 사용법 정리
Vast.ai에서 GPU 인스턴스를 검색, 생성, 관리하는 REST API 사용법을 정리한다. 오퍼 검색 필터링, 인스턴스 생성/삭제, SSH 접속까지.
OpenSearch 성능 벤치마크와 TPS별 서버 구성 가이드
OpenSearch의 워크로드별 성능 벤치마크와 TPS 기준 서버 구성 사례를 정리한다. Trail of Bits 테스트 결과, CPU/RAM 사양별 권장 구성, GPU 노드 활용 시나리오를 다룬다.
Qdrant GPU 인덱싱 가속 — Docker 이미지와 설정 가이드
Qdrant v1.13.0부터 지원하는 GPU 인덱싱 가속 기능을 정리한다. GPU 전용 Docker 이미지 사용법, production.yaml gpu 블록 설정, CUDA/Vulkan 디바이스 연동 방법을 다룬다.