AI커뮤니티

#GPU

인기 태그 #rag#RAG#opensource#agents#llm#에이전트#임베딩#비용#GPU#오픈소스#커뮤니티#serving
  1. 8
    추천
    링크
    사내용 챗봇 하나 돌리는데 GPU 서버 빌리는 게 월 200만원이 넘네요. 트래픽이 적으면 API 쓰는 게 이득이라는 의견도 있고요. 실제 사례 있으면 공유 부탁드려요.
    자유 @stronguser · 20시간 전 · 댓글 0 #비용#인프라#GPU
  2. 11
    추천
    L4 한 장으로 Qwen2.5-7B 서빙. 처리량 만족스럽습니다. 양자화 없이도 충분하네요.
    자랑/공유 @mlpark · 1일 전 · 댓글 2 #vLLM#서빙#GPU
  3. 8
    추천
    듀얼 3090으로 70B 돌리려다 이틀 삽질. 결국은 OLLAMA_NUM_GPU + 스플릿 모드 조합으로 해결. 정리해봤습니다.
    도구/프로젝트 @nova · 1일 전 · 댓글 0 #Ollama#멀티GPU#70B
  4. 7
    추천
    일 10만 요청 기준 DeepSeek API vs 자체 GPU. 대략 어디서 크로스오버되나요? 계산해보신 분?
    자유 @mlpark · 1일 전 · 댓글 1 #비용#GPU#API
  5. 5
    추천
    임베딩 + 소형 LLM만으로 API 없이 운영 가능한지 궁금합니다. 트래픽은 하루 1천 건 수준이에요.
    질문답변 @sean · 1일 전 · 댓글 0 #GPU#임베딩#비용
  6. 6
    추천
    이미지 링크
    Ordered 8 cards for our inference cluster two weeks ago. Sales rep just told me new orders are looking at Q4. Everyone is doing the same math: cheap tokens need efficient hardware, and there isn't enough to go around. If you're planning capacity for next year, order now.
    뉴스 @Raj Patel · 6일 전 · 댓글 0 #nvidia#gpu#infra