オンプレミス環境でLLMチャットボット導入を検討する中小企業
複数の営業所から月1000件のチャット問い合わせがあるが、クラウドAPI代が月額20万円を超えており、月次経費に困っている
SGLang で社内サーバーに Llama や Qwen などのオープンソースモデルをデプロイし、複数リクエストを効率的に処理するバッチ推論機能で同時実行数を高め、従来の1/10の応答時間で月額運用費3万円に削減したコンサルティング受託
初期セットアップ・モデル選定・チューニング で30万円の成功報酬、その後毎月1万円の保守運用費で継続受託