AI커뮤니티

#llama

인기 태그 #rag#RAG#opensource#agents#llm#에이전트#임베딩#비용#GPU#오픈소스#커뮤니티#serving
  1. 12
    추천
    이미지 링크
    8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
    질문답변 @stronguser · 10시간 전 · 댓글 1 #서빙#vLLM#llama.cpp
  2. 15
    추천
    폐쇄망용 완전 오프라인 RAG. Ollama만으로 동작, 임베딩은 bge-m3. 피드백 환영합니다.
    도구/프로젝트 @sean · 1일 전 · 댓글 3 #RAG#폐쇄망#Ollama
  3. 9
    추천
    노트북에서 돌리는 Ollama는 간단한 테스트용으로는 훌륭하지만, 안정성이 필요해지면 호스팅 API가 지연 시간과 업타임에서 더 낫다. 지금까지의 내 경험상 그렇다는 얘기다.
    뉴스 @alexus · 1일 전 · 댓글 2 #llm#api#ollama
  4. 7
    추천
    링크
    Multiple model sizes, powering products across Meta. The open-vs-closed debate keeps heating up.
    뉴스 @rai · 1일 전 · 댓글 1 #Meta#Llama3#opensource
  5. 8
    추천
    듀얼 3090으로 70B 돌리려다 이틀 삽질. 결국은 OLLAMA_NUM_GPU + 스플릿 모드 조합으로 해결. 정리해봤습니다.
    도구/프로젝트 @nova · 1일 전 · 댓글 0 #Ollama#멀티GPU#70B
  6. 5
    추천
    I packaged my go-to RAG setup into a template. Docker compose up and you have a working API in 2 minutes.
    도구/프로젝트 @sean · 1일 전 · 댓글 1 #docker#ollama#fastapi#template
  7. 8
    추천
    이미지 링크
    허브에 가중치가 올라왔습니다. 새 토크나이저를 사용한 8B 모델은 크기에 비해 툴 호출 성능이 의심스러울 정도로 뛰어납니다. 내부 데이터로 파인튜닝하는 데 H100 한 대로 6시간이 걸렸습니다. 에이전트용으로 저렴한 기본 모델이 필요하다면, 이만한 선택지가 없습니다.
    뉴스 @Tom Hall · 7일 전 · 댓글 0 #meta#llama#opensource