현재 회사에서 모델을 갈아끼우는 작업을 하면서 VLLM에 대해서 접하게 되었다. VLLM VLLM은 모델을 올려서 OPENAI의 모듈을 사용할 수 있는 방법이다. 보통 이런 것을 모델 서빙 이라고한다. Window, linux환경에서는 docker를 통해 vllm 이미지를 다운받아서 사용해야한다.docker run -d \ --name vllm-server-multi \ --runtime nvidia \ --gpus '"device=0,1"' \ -p 8000:8000 \ --ipc=host \ -v ~/.cache/huggingface:/root/.cache/huggingface \ -e HF_TOKEN="hf_xxxxxxxxxxxxxxxxxxxxx" \ vllm/vllm-openai:..