ollama配置使用GPU的方法步驟
發(fā)布時間:2026-04-30 10:32:23 作者:努力的小Qin
我要評論
本文介紹了在Windows系統(tǒng)上配置Ollama使用GPU加速的步驟,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
第一步:查看自己顯卡是否支持

第二步:查看本機顯卡參數(shù)
命令:nvidia-smi

第三步:安裝cuda toolkit
cuda toolkit下載地址:https://developer.nvidia.com/cuda-toolkit-archive
請記住流程安裝選local而非network
安裝完后驗證是否安裝成功,命令:nvcc --version

第四步:設(shè)置ollama 環(huán)境變量
添加以下環(huán)境變量:
- 變量名:OLLAMA_GPU_LAYER
- 變量值:cuda
指定特定的 GPU,可以添加以下環(huán)境變量:
- 變量名:CUDA_VISIBLE_DEVICES
- 變量值:GPU的UUID(方法如下)
GPU的UUID查看命令:nvidia-smi -L

第五步:驗證是否使用gpu
運行大模型

然后再起一個命令行 輸入 ollama ps 就可以看到 processor里面有cpu與gpu運行百分比

Ollama可配置環(huán)境變量
- OLLAMA_DEBUG: 顯示額外的調(diào)試信息(例如:OLLAMA_DEBUG=1)。
- OLLAMA_HOST: Ollama 服務(wù)器的 IP 地址(默認值:127.0.0.1:11434)。
- OLLAMA_KEEP_ALIVE: 模型在內(nèi)存中保持加載的時長(默認值:“5m”),設(shè)置為-1表示常駐內(nèi)存運行。
- OLLAMA_MAX_LOADED_MODELS: 每個 GPU 上最大加載模型數(shù)量。
- OLLAMA_MAX_QUEUE: 請求隊列的最大長度。
- OLLAMA_MODELS: 模型目錄的路徑。
- OLLAMA_NUM_PARALLEL: 最大并行請求數(shù)。
- OLLAMA_NOPRUNE: 啟動時不修剪模型 blob。
- OLLAMA_ORIGINS: 允許的源列表,使用逗號分隔。
- OLLAMA_SCHED_SPREAD: 始終跨所有 GPU 調(diào)度模型。
- OLLAMA_TMPDIR: 臨時文件的位置。
- OLLAMA_FLASH_ATTENTION: 啟用 Flash Attention。
- OLLAMA_LLM_LIBRARY: 設(shè)置 LLM 庫以繞過自動檢測。
windows系統(tǒng)上設(shè)置直接在環(huán)境變量中設(shè)置即可。
到此這篇關(guān)于ollama配置使用GPU的方法步驟的文章就介紹到這了,更多相關(guān)ollama配置GPU內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章,希望大家以后多多支持腳本之家!
相關(guān)文章
本文主要介紹了如何查看Ollama的GPU內(nèi)存使用情況,包括通過命令行工具ollamaps和任務(wù)管理器兩種方法,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考2026-03-09


