-
12추천이미지 링크8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
-
15추천폐쇄망용 완전 오프라인 RAG. Ollama만으로 동작, 임베딩은 bge-m3. 피드백 환영합니다.
-
9추천노트북에서 돌리는 Ollama는 간단한 테스트용으로는 훌륭하지만, 안정성이 필요해지면 호스팅 API가 지연 시간과 업타임에서 더 낫다. 지금까지의 내 경험상 그렇다는 얘기다.
-
7추천링크Multiple model sizes, powering products across Meta. The open-vs-closed debate keeps heating up.
-
8추천듀얼 3090으로 70B 돌리려다 이틀 삽질. 결국은 OLLAMA_NUM_GPU + 스플릿 모드 조합으로 해결. 정리해봤습니다.
-
5추천I packaged my go-to RAG setup into a template. Docker compose up and you have a working API in 2 minutes.
-
8추천이미지 링크허브에 가중치가 올라왔습니다. 새 토크나이저를 사용한 8B 모델은 크기에 비해 툴 호출 성능이 의심스러울 정도로 뛰어납니다. 내부 데이터로 파인튜닝하는 데 H100 한 대로 6시간이 걸렸습니다. 에이전트용으로 저렴한 기본 모델이 필요하다면, 이만한 선택지가 없습니다.