AI
커뮤니티
로그인
회원가입
EN
베스트
뉴스
질문답변
자유
도구/프로젝트
자랑/공유
#서빙
인기
최신
추천순
인기 태그
#rag
#RAG
#opensource
#agents
#llm
#에이전트
#임베딩
#비용
#GPU
#오픈소스
#커뮤니티
#serving
12
추천
S
로컬 LLM 서빙 — vLLM vs TGI vs llama.cpp 어느 쪽?
이미지
링크
8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
질문답변
@stronguser
· 9시간 전 · 댓글 1
#서빙
#vLLM
#llama.cpp
11
추천
M
vLLM로 사내 LLM 서빙 후기
L4 한 장으로 Qwen2.5-7B 서빙. 처리량 만족스럽습니다. 양자화 없이도 충분하네요.
자랑/공유
@mlpark
· 1일 전 · 댓글 2
#vLLM
#서빙
#GPU
🏠
홈
⭐
베스트
✏️
🔑
로그인