질문

웹서비스에 AI 도입하고 싶은데 최대한 저렴하게 쓰고싶어요

hshim 조회 337 댓글 9

LLM을 도입할 프로젝트가 생겼는데 비용에서 좀 걸리더라구요

최대한 저비용으로 장기 운영이 목표이다보니 조금이라도 아끼고 싶습니다

일단 gemini 3.1 flash lite 붙어봤는데 더 가벼운 모델도 상관 없어보이네요 (호출 당 약 입력 2.5k/출력 0.7k)

다양한 의견을 들어보고 싶습니다

댓글

  1. 구루

    어느 정도의 실시간 성이 필요한 것인가가 중요한거 같아요.
    llm 답변이 바로 나와야 하는 건지, 아니면 백그라운드에서 느리게 돌아도 되는건지 등이요

    말씀하신대로 저렴한 모델을 쓰는게 방법인데, Luna 가 엄청 싸지기도 했고, gemini 도 계속 버전 바뀌면서 가성비는 괜찮은거 같기는 하고요. 저렴한 gpu 들을 사서 qwen 같은 모델을 많이 돌리기도 합니다. m1 에서 m5 로 업글하신 분들은 m1 을 그렇게 해서 개인 llm 서버로 활용하더군요.

    편법으로는 개인 구독 계정을 API Proxy 로 돌려서 쓰는 방법도 있긴 합니다. openai-oauth 같은 것들이요.
    실시간 응답이 아니고, 서비스 일부에서만 쓴다면 이것도 많이들 활용하는 거 같아요

  2. hshim

    즉시 나와야 하는 실시간성으로 사용될 예정입니다
    길게 봐서 로컬 모델 구동용 개인서버 구축도 한번 고려 해 봐야겠군요

    듣고보니 Luna 가격 인하된게 생각나서 일단 모델 변경을 우선시 해야겠네요
    답변 감사합니다

  3. shintwl

    실시간성이 필요 없다면 배치 기능을 쓰면 엄청 아낄 수 있습니다

  4. hshim

    지금 상황은 실시간성이 필요하긴 한데 또 다른 상황 상 배치 도입도 괜찮을 것 같다는 생각이 드네요 감사합니다!

  5. primary1

    저는 개인 프로젝트 사용할 때 deepseek flash 사용했습니다, eval test 돌리면서 가장 싼 걸 찾으니까 이게 제일 괜찮더라구요

  6. hshim

    중국 기업은 생각도 안하고 있었는데 가성비 따졌을 땐 최고겠네요ㅋㅋㅋㅋ 감사합니다

  7. argo9

    다이소LLM이 나올 때가... 된거 같은데... 안타깝네요

  8. hsvtr365

    옴니라우트 쓰세용

  9. osteoporosis