ローカルLLM・小規模GPU環境における推論サービング設計とモデル選定を強みとしています。vLLM/SGLang/Ollama、量子化、KV Cache、並列推論、TTFT/ITLを実測し、用途・VRAM・レイテンシ・スループットから最適な実用構成を判断できます。
Location
TOKYO
Following Organizations
No Organizations you are following
$ analyze @Marron-chan
posted articles:
- vLLM:59%
- ローカルLLM:41%
- LLM:27%
- SGLang:20%
- Docker:17%
answered questions:
- No data