AI커뮤니티

#ama

인기 태그 #rag#RAG#opensource#agents#llm#에이전트#임베딩#비용#GPU#오픈소스#커뮤니티#serving
  1. 12
    추천
    이미지 링크
    8B~27B 모델을 서빙하려고 합니다. throughput이 중요하면 vLLM, VRAM이 빠듯하면 llama.cpp라는 얘기가 있는데 실제 운영하시는 분들 경험 공유 부탁드려요.
    질문답변 @stronguser · 10시간 전 · 댓글 1 #서빙#vLLM#llama.cpp
  2. 15
    추천
    폐쇄망용 완전 오프라인 RAG. Ollama만으로 동작, 임베딩은 bge-m3. 피드백 환영합니다.
    도구/프로젝트 @sean · 1일 전 · 댓글 3 #RAG#폐쇄망#Ollama
  3. 9
    추천
    노트북에서 돌리는 Ollama는 간단한 테스트용으로는 훌륭하지만, 안정성이 필요해지면 호스팅 API가 지연 시간과 업타임에서 더 낫다. 지금까지의 내 경험상 그렇다는 얘기다.
    뉴스 @alexus · 1일 전 · 댓글 2 #llm#api#ollama
  4. 7
    추천
    링크
    Multiple model sizes, powering products across Meta. The open-vs-closed debate keeps heating up.
    뉴스 @rai · 1일 전 · 댓글 1 #Meta#Llama3#opensource
  5. 8
    추천
    듀얼 3090으로 70B 돌리려다 이틀 삽질. 결국은 OLLAMA_NUM_GPU + 스플릿 모드 조합으로 해결. 정리해봤습니다.
    도구/프로젝트 @nova · 1일 전 · 댓글 0 #Ollama#멀티GPU#70B
  6. 5
    추천
    I packaged my go-to RAG setup into a template. Docker compose up and you have a working API in 2 minutes.
    도구/프로젝트 @sean · 1일 전 · 댓글 1 #docker#ollama#fastapi#template
  7. 6
    추천
    두 달이 지났는데, 아직 후회는 없어요. 오픈 에이전트 프레임워크를 만들고 있고, 저축으로 생활하고 있어요. 오픈 소스 생태계는 혼란스럽지만 그 속도감이 중독적이에요. 전직, 돈, 또는 실제로 하루종일 뭘 하는지에 대한 질문에 기꺼이 답변할게요.
    자유 @Emily Watson · 4일 전 · 댓글 0 #career#opensource#ama
  8. 8
    추천
    이미지 링크
    허브에 가중치가 올라왔습니다. 새 토크나이저를 사용한 8B 모델은 크기에 비해 툴 호출 성능이 의심스러울 정도로 뛰어납니다. 내부 데이터로 파인튜닝하는 데 H100 한 대로 6시간이 걸렸습니다. 에이전트용으로 저렴한 기본 모델이 필요하다면, 이만한 선택지가 없습니다.
    뉴스 @Tom Hall · 7일 전 · 댓글 0 #meta#llama#opensource