ローカルLLM・小規模GPU環境における推論サービング設計とモデル選定を強みとしています。vLLM/SGLang/Ollama、量子化、KV Cache、並列推論、TTFT/ITLを実測し、用途・VRAM・レイテンシ・スループットから最適な実用構成を判断できます。
Location
TOKYO
Following Organizations
No Organizations you are following
$ analyze @Marron-chan
posted articles:
- vLLM:57%
- ローカルLLM:40%
- LLM:28%
- SGLang:20%
- Docker:18%
answered questions:
- No data