Ollama 運(yùn)行模型(Ollama 模型的簡(jiǎn)要指南)
運(yùn)行 Ollama 模型是在本地使用大語(yǔ)言模型(LLM)進(jìn)行推理、對(duì)話或其他任務(wù)的核心步驟。以下是運(yùn)行 Ollama 模型的簡(jiǎn)要指南,涵蓋拉取模型、運(yùn)行模型以及常見(jiàn)配置,適用于已安裝 Ollama 的 Windows、macOS 或 Linux 系統(tǒng)。
一. 拉取模型
在運(yùn)行模型之前,需要從 Ollama 模型庫(kù)下載模型到本地。
命令:
ollama pull <model-name>
示例:拉取 LLaMA 3 模型(8B 參數(shù)版本):
ollama pull llama3
常見(jiàn)模型:
llama3:Meta 的 LLaMA 3,適合通用任務(wù)。mistral:Mistral AI 的高效模型。phi3:微軟的輕量級(jí)模型,適合低配置設(shè)備。
查看更多模型:訪問(wèn) Ollama 模型庫(kù) 或運(yùn)行 ollama list。
注意:
模型文件較大(幾 GB),確保網(wǎng)絡(luò)穩(wěn)定和磁盤空間充足。
可選擇不同大小的模型(如 llama3:8b 或 llama3:70b),小模型更適合低配硬件。
二. 運(yùn)行模型
Ollama 提供兩種主要方式運(yùn)行模型:交互式終端和 API 調(diào)用。
方式 1:交互式終端
命令:
ollama run <model-name>
示例:
ollama run llama3
效果:
進(jìn)入交互模式,直接輸入提示(prompt)與模型對(duì)話。
示例輸入:What is the capital of France? 模型會(huì)返回 The capital of France is Paris.
退出:輸入 /exit 或按 Ctrl+D。
方式 2:通過(guò) API 運(yùn)行
Ollama 提供 REST API,適合集成到應(yīng)用或腳本中。
默認(rèn)地址:http://localhost:11434
示例(使用 curl):
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Write a short poem about the moon."
}'響應(yīng):模型會(huì)返回生成的文本,格式為 JSON。
編程集成:使用 Python、Node.js 等調(diào)用 API。例如 Python 代碼:
import requests
response = requests.post('http://localhost:11434/api/generate', json={
'model': 'llama3',
'prompt': 'Hello, world!'
})
print(response.json())三. 管理運(yùn)行中的模型
查看已下載模型:
ollama list
刪除模型(釋放空間):
ollama rm <model-name>
查看運(yùn)行狀態(tài):
ollama ps
AI寫代碼bash
顯示當(dāng)前運(yùn)行的模型實(shí)例。
四. 優(yōu)化運(yùn)行性能
硬件要求:
小模型(如 phi3):4-8GB 內(nèi)存即可。
大模型(如 llama3:70b):建議 16GB+ 內(nèi)存和 GPU。
GPU 支持:
確保安裝 NVIDIA CUDA 驅(qū)動(dòng)(Linux/Windows)或 Metal(macOS)。
Ollama 自動(dòng)檢測(cè)并使用 GPU 加速(若可用)。
參數(shù)調(diào)整:
使用 --verbose 查看運(yùn)行詳情。
自定義模型參數(shù)(如溫度、top-k):通過(guò) API 指定,例如:
{
"model": "llama3",
"prompt": "Tell a story",
"temperature": 0.7,
"top_p": 0.9
}多模型運(yùn)行:
Ollama 支持同時(shí)運(yùn)行多個(gè)模型,但需足夠內(nèi)存和 CPU/GPU 資源。
五. 常見(jiàn)問(wèn)題
模型未找到:確保已通過(guò) ollama pull 下載模型。
運(yùn)行緩慢:嘗試更小模型或啟用 GPU 加速。
端口占用:Ollama 默認(rèn)使用 11434 端口,若沖突,可通過(guò)環(huán)境變量修改:
export OLLAMA_HOST=127.0.0.1:11435
內(nèi)存不足:關(guān)閉其他程序或選擇更小模型。
六. 進(jìn)階使用
自定義模型:[通過(guò) Modelfile 創(chuàng)建自定義模型,定義提示、參數(shù)等:
ollama create mymodel -f Modelfile
批量處理:編寫腳本循環(huán)調(diào)用 API,處理大量任務(wù)。
嵌入生成:使用 /api/embeddings 端點(diǎn)生成文本嵌入,適用于搜索或分類任務(wù)。
示例場(chǎng)景
對(duì)話:運(yùn)行 ollama run mistral 與模型聊天。
代碼生成:輸入 Write a Python script to sort a list 獲取代碼。
API 集成:將 Ollama 嵌入 Web 應(yīng)用,實(shí)時(shí)生成內(nèi)容。
如需特定模型運(yùn)行示例、API 集成代碼或故障排除幫助,請(qǐng)告訴我!
七.ollama run 命令
Ollama 運(yùn)行模型使用 ollama run 命令。
例如我們要運(yùn)行 Llama 3.2 并與該模型對(duì)話可以使用以下命令:
ollama run llama3.2
執(zhí)行以上命令如果沒(méi)有該模型會(huì)去下載 llama3.2 模型:

等待下載完成后,我們?cè)诮K端中,輸入以下命令來(lái)加載 LLama3.2 模型并進(jìn)行交互:
writing manifest success >>> 你好 Hello >>> 能講中文嗎 是的,我可以在 Chinese 中對(duì)話。哪些話題或問(wèn)題想要了解我呢?
結(jié)束對(duì)話可以輸入 /bye 或按 Ctrl+d 按鍵來(lái)結(jié)束。
我們可以使用 ollama list,查看已安裝的模型:
NAME ID SIZE MODIFIED llama3.2 baf6a787fdff 1.3 GB 4 minutes ago
Ollama 支持的模型可以訪問(wèn):https://ollama.com/library

下表列出一些模型的下載命令:
| 模型 | 參數(shù) | 大小 | 下載命令 |
|---|---|---|---|
| Llama 3.3 | 70B | 43GB | ollama run llama3.3 |
| Llama 3.2 | 3B | 2.0GB | ollama run llama3.2 |
| Llama 3.2 | 1B | 1.3GB | ollama run llama3.2:1b |
| Llama 3.2 Vision | 11B | 7.9GB | ollama run llama3.2-vision |
| Llama 3.2 Vision | 90B | 55GB | ollama run llama3.2-vision:90b |
| Llama 3.1 | 8B | 4.7GB | ollama run llama3.1 |
| Llama 3.1 | 405B | 231GB | ollama run llama3.1:405b |
| Phi 4 | 14B | 9.1GB | ollama run phi4 |
| Phi 3 Mini | 3.8B | 2.3GB | ollama run phi3 |
| Gemma 2 | 2B | 1.6GB | ollama run gemma2:2b |
| Gemma 2 | 9B | 5.5GB | ollama run gemma2 |
| Gemma 2 | 27B | 16GB | ollama run gemma2:27b |
| Mistral | 7B | 4.1GB | ollama run mistral |
| Moondream 2 | 1.4B | 829MB | ollama run moondream |
| Neural Chat | 7B | 4.1GB | ollama run neural-chat |
| Starling | 7B | 4.1GB | ollama run starling-lm |
| Code Llama | 7B | 3.8GB | ollama run codellama |
| Llama 2 Uncensored | 7B | 3.8GB | ollama run llama2-uncensored |
| LLaVA | 7B | 4.5GB | ollama run llava |
| Solar | 10.7B | 6.1GB | ollama run solar |
八.通過(guò) Python SDK 使用模型
如果你希望將 Ollama 與 Python 代碼集成,可以使用 Ollama 的 Python SDK 來(lái)加載和運(yùn)行模型。
1. 安裝 Python SDK
首先,需要安裝 Ollama 的 Python SDK,打開終端,執(zhí)行以下命令:
pip install ollama
2. 編寫 Python 腳本
接下來(lái),你可以使用 Python 代碼來(lái)加載和與模型交互。
以下是一個(gè)簡(jiǎn)單的 Python 腳本示例,演示如何使用 LLama3.2 模型來(lái)生成文本:
import?ollama response?=?ollama.generate( ? ? model="llama3.2",??# 模型名稱 ? ? prompt="你是誰(shuí)。"??# 提示文本 ) print(response)
3. 運(yùn)行 Python 腳本
在終端中運(yùn)行你的 Python 腳本:
python test.py
你會(huì)看到模型根據(jù)你的輸入返回的回答。
4.對(duì)話模式
from?ollama?import?chat
response?=?chat(
? ? model="llama3.2",
? ? messages=[
? ? ? ??{"role":?"user",?"content":?"為什么天空是藍(lán)色的?"}
? ??]
)
print(response.message.content)此代碼會(huì)與模型進(jìn)行對(duì)話,并打印模型的回復(fù)。
5. 流式響應(yīng)
from?ollama?import?chat
stream?=?chat(
? ? model="llama3.2",
? ? messages=[{"role":?"user",?"content":?"為什么天空是藍(lán)色的?"}],
? ? stream=True
)
for?chunk?in?stream:
? ??print(chunk["message"]["content"],?end="",?flush=True)此代碼會(huì)以流式方式接收模型的響應(yīng),適用于處理大數(shù)據(jù)。
相關(guān)文章

Ollama中本地大模型部署與運(yùn)行深度評(píng)測(cè)詳解
本文對(duì)開源本地大模型運(yùn)行工具Ollama進(jìn)行了全面深度評(píng)測(cè),涵蓋硬件兼容性、性能表現(xiàn)、功能特性、安全性等10個(gè)核心維度,基于2026年最新版本(v0.19.0)的實(shí)測(cè)數(shù)據(jù),結(jié)合客觀2026-06-01
這段文章詳細(xì)介紹了Ollama、LMStudio、TextGenerationWebUI和vLLM四種部署方式,適合不同模型的本地和企業(yè)環(huán)境部署,文章還提供了Ollama的下載指南和免費(fèi)開源大模型的推薦版2026-05-25
Windows版Ollama強(qiáng)制安裝到C盤的五種方案
Ollama 官方 Windows 安裝程序沒(méi)有提供路徑選擇,直接雙擊就只有“Install”按鈕,但我們可以通過(guò)以下方法實(shí)現(xiàn)自定義安裝路徑,需要的朋友可以參考下2026-05-20
2026最新Linux本地部署Ollama安裝全流程(含離線/開機(jī)自啟/遠(yuǎn)程訪問(wèn))
本文記錄在 CentOS 7+ / Ubuntu 20.04+ 上部署 Ollama 的實(shí)操筆記,覆蓋 一鍵在線安裝 與 離線 tar 包安裝 兩種方式,并補(bǔ)充 systemd 開機(jī)自啟、qwen2 / deepseek-r1 等模2026-05-19
一篇帶你搞定Ollama模型的安裝到生產(chǎn)級(jí)調(diào)優(yōu)
Ollama 是一個(gè)輕量級(jí)、可擴(kuò)展的本地大語(yǔ)言模型運(yùn)行框架,旨在簡(jiǎn)化 LLM 的部署、管理和使用流程,本文主要為大家詳細(xì)介紹了Ollama模型的部署、管理和使用,有需要的小伙伴可以2026-05-13
Ollama無(wú)法通過(guò)本地IP訪問(wèn)11434端口的解決方案
在嘗試將 Ollama 的 localhost 地址替換為本地 IP 地址(如 192.168.*.*)時(shí),遇到了網(wǎng)絡(luò)錯(cuò)誤,提示無(wú)法連接到服務(wù),本文給大家介紹了可能的原因和解決方案,需要的朋友可以2026-05-12
Ollama下載的模型如何導(dǎo)入LLama-Factory進(jìn)行二次微調(diào)
本文介紹如何將Ollama下載的GGUF格式模型轉(zhuǎn)換為Hugging Face格式,并通過(guò)LLama-Factory進(jìn)行LoRA微調(diào),涵蓋模型提取、格式轉(zhuǎn)換、訓(xùn)練配置及合并導(dǎo)出全流程,幫助開發(fā)者在本地2026-05-12
本文介紹了在Windows系統(tǒng)上配置Ollama使用GPU加速的步驟,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起2026-04-30
本文介紹了如何利用Ollama和LangChain構(gòu)建基礎(chǔ)AIAgent,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)2026-04-29
Windows系統(tǒng)使用Ollama部署本地大模型的實(shí)現(xiàn)步驟
本文主要介紹了在Ollama平臺(tái)下載和安裝AI模型的方法,包括點(diǎn)擊按鈕安裝和使用指令下載兩種方式,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)2026-04-29











