Linux上設置Ollama服務配置(常用環(huán)境變量)
在 Linux 上設置環(huán)境變量
1. 通過調用
systemctl edit ollama.service編輯 systemd 服務。這將打開一個編輯器。這邊可以直接通過vim /etc/systemd/system/ollama.service,打開編輯。2. 對于每個環(huán)境變量,在
[Service]部分下添加一行Environment:
vim /etc/systemd/system/ollama.service Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_ORIGINS=*" Environment="OLLAMA_DEBUG=1" Environment="OLLAMA_FLASH_ATTENTION=1" 對于每個環(huán)境變量,在[Service]部分下添加一行Environment. 1. OLLAMA_HOST=0.0.0.0 外網(wǎng)訪問 2. OLLAMA_MODELS=/mnt/data/.ollama/models 模型默認下載路徑 3. OLLAMA_KEEP_ALIVE=24h 設置模型加載到內存中保持 24 個小時(默認情況下,模型在卸載之前會在內存中保留 5 分鐘) 4. OLLAMA_HOST=0.0.0.0:8080 修改默認端口 11434 端口 5. OLLAMA_NUM_PARALLEL=2 設置 2 個用戶并發(fā)請求 6. OLLAMA_MAX_LOADED_MODELS=2 設置同時加載多個模型 #為了使更改生效,您需要重新加載systemd的配置。使用以下命令: sudo systemctl daemon-reload #最后,重啟服務以應用更改: sudo systemctl restart ollama 默認情況下,ollama模型的存儲目錄如下: macOS: `~/.ollama/models` Linux: `/usr/share/ollama/.ollama/models` Windows: `C:\Users\<username>\.ollama\models` journalctl -u ollama | grep -i 'prompt=' #查看日志 /set verbose #設置以查看token速度
配置 Ollama
Ollama 提供了多種環(huán)境變量以供配置:
OLLAMA_DEBUG:是否開啟調試模式,默認為 false。
OLLAMA_FLASH_ATTENTION:是否閃爍注意力,默認為 true。
OLLAMA_HOST:Ollama 服務器的主機地址,默認為空。
OLLAMA_KEEP_ALIVE:保持連接的時間,默認為 5m。
OLLAMA_LLM_LIBRARY:LLM 庫,默認為空。
OLLAMA_MAX_LOADED_MODELS:最大加載模型數(shù),默認為 1。
OLLAMA_MAX_QUEUE:最大隊列數(shù),默認為空。
OLLAMA_MAX_VRAM:最大虛擬內存,默認為空。
OLLAMA_MODELS:模型目錄,默認為空。
OLLAMA_NOHISTORY:是否保存歷史記錄,默認為 false。
OLLAMA_NOPRUNE:是否啟用剪枝,默認為 false。
OLLAMA_NUM_PARALLEL:并行數(shù),默認為 1。
OLLAMA_ORIGINS:允許的來源,默認為空。
OLLAMA_RUNNERS_DIR:運行器目錄,默認為空。
OLLAMA_SCHED_SPREAD:調度分布,默認為空。
OLLAMA_TMPDIR:臨時文件目錄,默認為空。Here is the optimized list in the desired format:
OLLAMA_DEBUG:是否開啟調試模式,默認為 false。
OLLAMA_FLASH_ATTENTION:是否閃爍注意力,默認為 true。
OLLAMA_HOST:Ollama 服務器的主機地址,默認為空。
OLLAMA_KEEP_ALIVE:保持連接的時間,默認為 5m。
OLLAMA_LLM_LIBRARY:LLM 庫,默認為空。
OLLAMA_MAX_LOADED_MODELS:最大加載模型數(shù),默認為 1。
OLLAMA_MAX_QUEUE:最大隊列數(shù),默認為空。
OLLAMA_MAX_VRAM:最大虛擬內存,默認為空。
OLLAMA_MODELS:模型目錄,默認為空。
OLLAMA_NOHISTORY:是否保存歷史記錄,默認為 false。
OLLAMA_NOPRUNE:是否啟用剪枝,默認為 false。
OLLAMA_NUM_PARALLEL:并行數(shù),默認為 1。
OLLAMA_ORIGINS:允許的來源,默認為空。
OLLAMA_RUNNERS_DIR:運行器目錄,默認為空。
OLLAMA_SCHED_SPREAD:調度分布,默認為空。
OLLAMA_TMPDIR:臨時文件目錄,默認為空。
Ollama使用常見的指令:
ollama serve #啟動ollama
ollama create #從模型文件創(chuàng)建模型
ollama show #顯示模型信息
ollama run #運行模型
ollama pull #從注冊表中拉取模型
ollama push #將模型推送到注冊表
ollama list #列出模型
ollama cp #復制模型
ollama rm #刪除模型
ollama help #獲取有關任何命令的幫助信息
導入huggingface模型
最新版Ollama開始支持從Huggingface Hub上直接拉取各種模型,包括社區(qū)創(chuàng)建的GGUF量化模型。用戶可以通過簡單的命令行指令快速運行這些模型,可以使用如下命令:
ollama run hf.co/{username}/{repository}
要選擇不同的量化方案,只需在命令中添加一個標簽:
ollama run hf.co/{username}/{repository}:{quantization}
例如:量化名稱不區(qū)分大小寫
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:IQ3_M
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Q8_0
還可以直接使用完整的文件名作為標簽:
ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Llama-3.2-3B-Instruct-IQ3_M.gguf手動安裝
下載并解壓壓縮包
curl -L https://ollama.com/download/ollama-linux-amd64.tgz -o ollama-linux-amd64.tgz sudo tar -C /usr -xzf ollama-linux-amd64.tgz
啟動ollama ollama serve
安裝特定版本
OLLAMA_VERSION環(huán)境變量與安裝腳本一起使用,以安裝特定版本的 Ollama,包括預發(fā)行版??梢栽?releases 頁面中找到版本號。
releases頁面:https://github.com/ollama/ollama/releases 例如: curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.3.9 sh
查看日志
要查看作為服務運行的 Ollama 的日志,請運行:
journalctl -e -u ollama
到此這篇關于Linux上設置Ollama服務配置(常用環(huán)境變量)的文章就介紹到這了,更多相關Ollama服務配置內容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關文章希望大家以后多多支持腳本之家!
相關文章
MobaXterm遠程連接Linux服務器(Ubuntu)圖文教程
這篇文章主要為大家介紹了MobaXterm遠程連接Linux服務器(Ubuntu)的相關教程,文中通過圖文進行了詳細的總結,需要的小伙伴可以收藏下2023-08-08
詳解DeepSeek如何通過Ollama解決常見本地部署報錯問題
這篇文章主要為大家詳細介紹了DeepSeek如何通過Ollama本地部署時可能遇到的幾種常見報錯問題并提供解決方案,感興趣的小伙伴可以了解下2025-02-02
fastjson到底做錯了什么?為什么會被頻繁爆出漏洞?(推薦)
前段時間,fastjson被爆出過多次存在漏洞,很多文章報道了這件事兒,并且給出了升級建議。本文給大家分享fastjson的releaseNote以及部分源代碼。感興趣的朋友跟隨小編一起看看吧2020-07-07

