질문
웹서비스에 AI 도입하고 싶은데 최대한 저렴하게 쓰고싶어요
LLM을 도입할 프로젝트가 생겼는데 비용에서 좀 걸리더라구요
최대한 저비용으로 장기 운영이 목표이다보니 조금이라도 아끼고 싶습니다
일단 gemini 3.1 flash lite 붙어봤는데 더 가벼운 모델도 상관 없어보이네요 (호출 당 약 입력 2.5k/출력 0.7k)
다양한 의견을 들어보고 싶습니다
LLM을 도입할 프로젝트가 생겼는데 비용에서 좀 걸리더라구요
최대한 저비용으로 장기 운영이 목표이다보니 조금이라도 아끼고 싶습니다
일단 gemini 3.1 flash lite 붙어봤는데 더 가벼운 모델도 상관 없어보이네요 (호출 당 약 입력 2.5k/출력 0.7k)
다양한 의견을 들어보고 싶습니다
어느 정도의 실시간 성이 필요한 것인가가 중요한거 같아요.
llm 답변이 바로 나와야 하는 건지, 아니면 백그라운드에서 느리게 돌아도 되는건지 등이요
말씀하신대로 저렴한 모델을 쓰는게 방법인데, Luna 가 엄청 싸지기도 했고, gemini 도 계속 버전 바뀌면서 가성비는 괜찮은거 같기는 하고요. 저렴한 gpu 들을 사서 qwen 같은 모델을 많이 돌리기도 합니다. m1 에서 m5 로 업글하신 분들은 m1 을 그렇게 해서 개인 llm 서버로 활용하더군요.
편법으로는 개인 구독 계정을 API Proxy 로 돌려서 쓰는 방법도 있긴 합니다. openai-oauth 같은 것들이요.
실시간 응답이 아니고, 서비스 일부에서만 쓴다면 이것도 많이들 활용하는 거 같아요
즉시 나와야 하는 실시간성으로 사용될 예정입니다
길게 봐서 로컬 모델 구동용 개인서버 구축도 한번 고려 해 봐야겠군요
듣고보니 Luna 가격 인하된게 생각나서 일단 모델 변경을 우선시 해야겠네요
답변 감사합니다
실시간성이 필요 없다면 배치 기능을 쓰면 엄청 아낄 수 있습니다
지금 상황은 실시간성이 필요하긴 한데 또 다른 상황 상 배치 도입도 괜찮을 것 같다는 생각이 드네요 감사합니다!
저는 개인 프로젝트 사용할 때 deepseek flash 사용했습니다, eval test 돌리면서 가장 싼 걸 찾으니까 이게 제일 괜찮더라구요
중국 기업은 생각도 안하고 있었는데 가성비 따졌을 땐 최고겠네요ㅋㅋㅋㅋ 감사합니다
다이소LLM이 나올 때가... 된거 같은데... 안타깝네요
옴니라우트 쓰세용