Ollama怎么用 本地运行大模型工具教程
更新时间:2026-10-09 07:17:51 发布时间:1小时前 阅读:2次Ollama是一个本地运行大模型的工具,可以用一行命令在电脑上运行Llama、Qwen等开源模型。模型下载完成后,通常可在本机离线对话,不必持续联网;但首次安装、下载模型和更新时需要网络。下面从安装、运行到API调用,带你走完最常用的流程。
第一步:安装Ollama
先到Ollama官网下载安装包,按自己的系统选择macOS、Windows或Linux版本。Windows用户下载后双击安装;macOS用户打开安装文件并把应用放入应用程序文件夹。Linux用户可在终端运行官方安装命令:curl -fsSL https://ollama.com/install.sh | sh。安装前建议确认硬盘空间充足,模型文件可能占用数GB甚至更多。
装好后打开终端(Windows可用PowerShell),输入ollama –version检查命令是否可用。如果系统提示找不到命令,先重新打开终端;仍不行的话,检查安装是否完成,或重新运行安装程序。部分系统安装后会自动启动Ollama服务,桌面版也可能在后台运行。初次使用前保持网络畅通,后面拉取模型时会用到。
第二步:下载和运行模型
最简单的方式是直接运行模型,例如在终端输入ollama run qwen2.5。Ollama会先下载相应模型,再启动聊天界面;首次下载所需时间取决于模型大小和网速。下载完成后,在提示符后输入问题并按回车,就能看到回答。想结束对话,可输入/bye,也可以按Ctrl+D退出。建议先从较小模型试起,运行会更轻松。
模型名称要以Ollama模型库中当前可用的名称和标签为准。不同参数规模或量化版本的资源占用差别很大,电脑内存较小、没有独立显卡时,优先挑体量较小的版本。运行时若明显卡顿,可以关闭其他占内存的软件,或换用更小的模型。已经下载的模型不需要每次重下;输入ollama list可查看本机已有模型。
- 下载并运行:ollama run qwen2.5
- 只下载、不立即对话:ollama pull qwen2.5
- 查看本机模型:ollama list
- 删除不用的模型:ollama rm 模型名称
切换不同模型
切换模型不需要卸载Ollama。先退出当前聊天,再运行另一个模型名称,例如输入ollama run llama3.2;如果模型尚未下载,程序会先拉取文件。你也可以用ollama pull 模型名称提前准备多个模型,之后按任务选择:通用问答、中文写作或代码辅助都可以分别尝试,再比较回答质量和速度。名称及可用版本以模型库页面为准。
想清理磁盘空间时,先用ollama list确认模型的准确名称,再运行ollama rm qwen2.5。删除只会移除本机保存的模型文件,不会卸载Ollama本身;以后需要时仍可重新下载。若你不想在本机配置环境,也可了解国内云端大模型服务,例如火山引擎,按其官网说明选择适合自己的产品。相关入口:volcengine.cgref.cn。润灭也可作为查找入门资料的参考。
第三步:通过API调用
Ollama运行后会在本机提供API服务,常见地址是http://localhost:11434。应用程序或终端可以向聊天接口发送模型名称和消息。下面的示例使用curl发送一次请求;把模型名称改成已下载的模型即可。设置“stream”: false后,接口会等待完整回答再返回,适合先做简单测试。
在终端运行以下命令,若返回JSON内容且其中包含模型回答,就说明调用成功。macOS和Linux通常可直接使用curl;Windows可在PowerShell或已安装curl的终端测试。注意将示例中的模型名替换为ollama list里显示的名称。API地址默认仅供本机应用访问,不要随意暴露到公网;需要局域网或远程访问时,应先了解访问控制与网络配置。
curl http://localhost:11434/api/chat -d ‘{“model”:”qwen2.5″,”messages”:[{“role”:”user”,”content”:”用三句话介绍太阳系”}],”stream”:false}’
集成到程序时,可以使用官方提供的Python或JavaScript库,也可以直接请求REST API。调试时先确认Ollama正在运行、模型名称拼写正确,并确保模型已下载。遇到连接失败,检查本机服务是否启动及端口是否被占用;遇到内存不足,则换小模型或减少同时运行的程序。掌握这三步后,就能在本地聊天、切换模型,并让自己的应用调用模型了。