ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

本地部署DeepSeek R1:Ollama与Cherry Studio实战指南

本地部署DeepSeek R1:Ollama与Cherry Studio实战指南 简介面向需要本地运行DeepSeek的开发者、研究者及普通用户这份PDF手册以零门槛方式拆解R1模型的完整部署流程。内容先从Ollama开源工具的安装与验证讲起再按8GB、16GB、32GB内存给出7B、13B、33B等版本的选型建议和对应安装命令同时补充用Cherry-Studio实现界面对话与构建本地知识库的可选路径。每一步都配有具体指引和注意事项能有效降低初学者的操作难度帮助读者快速掌握从环境准备到模型运行的完整链路也方便后续按需调整参数或更换模型版本。整包仅包含1个PDF文件大小约819KB内容精炼且便于随时查阅。该手册已有506人浏览学习适合希望摆脱云端依赖、在个人电脑上快速集成大语言模型能力的科研探索、产品开发或日常学习者对照操作即可完成一次稳定的本地化部署。1. 本地跑 DeepSeek R1一台普通电脑能做的事如果你还在以为本地部署大模型必须有一块 24GB 显存的显卡那 DeepSeek R1 会刷新你的认知。用 Ollama 这样的工具一台 16GB 内存的办公笔记本就能把 7B 或 8B 模型跑起来速度虽然赶不上云端 API但对于代码生成、文档问答、私有数据提取这些场景已经足够实用。本地部署带来的直接好处是数据不出内网、不按 token 付费、离线也能用同时还方便接进内部的 IDE、知识库和自动化流程。这篇文章会把 Ollama 安装、DeepSeek R1 模型选型、Cherry Studio 界面化接入这一整条链路拆开讲顺便把内存配置、端口、环境变量这些容易卡住的细节说清楚。2. Ollama把大模型变成一条命令行指令2.1 为什么选 Ollama 而不直接跑 Transformers很多人第一次接触本地大模型时第一反应是去 Hugging Face 下载权重然后写一段 PyTorch 代码调用。这样做不是不行但环境依赖会让你先消耗掉半天时间Python 版本、CUDA 版本、tokenizer、推理框架、加载量化权重每一步都可能踩坑。Ollama 的思路是把这个过程封装成类似 Docker 的操作方式模型权重、依赖库、推理服务全部打包用户只需要两条命令一条拉镜像一条启动容器。它的核心组件包括模型管理、推理引擎和一个默认监听在 11434 端口的 HTTP 服务。而这个 HTTP 服务本身兼容 OpenAI 风格的接口意味着你后续接 Cherry Studio、Dify、VS Code 插件或者自己写脚本调用都可以复用同一套 API 习惯不需要为大模型单独开发适配层。这就是它比手动部署更适合快速落地的原因。2.2 安装流程与命令行验证Ollama 的安装包分平台Windows 用户拿到的是OllamaSetup.exe双击后一路 Next 即可。macOS 用户可以通过 Homebrew 安装Linux 用户则使用官方安装脚本。安装这个环节几乎不涉及配置真正的分水岭在安装完成后的验证。# Windows PowerShell 或 CMD ollama --version # macOS / Linux curl -fsSL https://ollama.com/install.sh | sh ollama --version第一行用于确认安装结果输出类似ollama version 0.x.x就说明程序已经进入 PATH。Linux 脚本会自动配置 systemd 服务并把 Ollama 注册为开机启动Windows 安装包会自动在后台启动ollama app.exe这些都不需要手动干预。如果命令行提示找不到命令常见的做法是检查安装目录下的ollama.exe是否被加入系统 PATH或者重新打开一个终端窗口让环境变量生效。验证通过之后Ollama 的服务默认已经跑起来了只是当前还没有模型。你可以用ollama serve手动启动服务也可以直接进入下一环节让ollama run自动拉起模型。2.3 默认端口与模型目录两个关键点Ollama 默认监听127.0.0.1:11434这个地址只能本机访问。后续如果通过 Cherry Studio 或局域网内其他设备连接需要调整环境变量OLLAMA_HOST为0.0.0.0:11434。另一个容易忽略的是模型存储目录Windows 通常在C:\Users\xxx\.ollama\modelsLinux 和 macOS 在~/.ollama/models。一个 7B 模型的 Q4 量化文件大约 4GB 多如果系统盘空间吃紧建议提前把目录换到其他分区。设置方式在 Windows 上是系统环境变量Linux 上可以在启动服务前导出export OLLAMA_MODELS/data/ollama/models ollama serve注意不要在 Ollama 服务运行时修改OLLAMA_MODELS否则已下载的模型不会被自动迁移。修改之后需要重启服务并重新下载或手动移动旧模型文件。这个坑在部署到磁盘空间较小的云主机时特别明显提前规划能省很多事。3. DeepSeek R1 版本选型与模型拉取3.1 先按内存规模确定参数级别DeepSeek R1 在 Ollama 仓库里有多种参数规模的标签官方手册里的对照表给出的是一个非常保守的推荐8GB 内存可以运行 7B 模型16GB 内存对应 13B32GB 内存对应 33B。这个参考值的前提是模型被量化为 Q4并且推理时主要靠 CPU 和内存承担。如果你有独立显卡判断标准可以放宽到显存大小因为 GPU 推理时显存占用是主要瓶颈。参数规模推荐内存推荐场景7B / 8B8GB代码补全、轻量问答、日志摘要13B / 14B16GB复杂推理、长文本理解、结构化输出33B / 32B32GB专业领域分析、高质量内容生成选择时要注意Ollama 中的标签是deepseek-r1:7b、deepseek-r1:8b、deepseek-r1:13b这样的格式。老手册里的 7B/13B/33B 对应的是当时主推版本现在官方列表里也出现了 1.5B、8B、14B、32B、70B 等更多选择实际以 ollama.com/library/deepseek-r1 页面上的 Tags 为准。我一般建议起步直接选 8B因为它在生成质量和资源占用之间最均衡16GB 内存的电脑跑起来不会觉得卡。3.2 拉取命令与对话模式确定好标签之后最直接的方式是复制 Ollama 模型库页面上对应的命令# 只下载模型不进入对话 ollama pull deepseek-r1:8b # 下载并进入交互式对话 ollama run deepseek-r1:8bollama pull做的事情是把模型权重拉到本地并校验完整性适合批量预下载。ollama run会在本地没有该模型时自动执行 pull下载完成后进入一个类似终端内的 ChatGPT 界面输入问题直接回车就能对话。两条命令的区别在后端逻辑上pull 只执行下载与注册run 则会加载模型到内存并创建推理会话。下载过程中终端会显示进度条。如果下载到一半卡住不要急着 CtrlCOllama 的下载支持断点续传中断后重新执行同一个命令会从上次位置继续。如果网络环境差建议临时设置代理但不要随意更换模型源否则可能出现校验失败。3.3 对话退出与模型管理在ollama run的交互界面里按CtrlD或输入/bye可以退出模型会保留在本地。之后想再次使用直接执行ollama run deepseek-r1:8b不需要重复下载。想查看当前已安装的模型、磁盘占用以及模型文件的详细信息可以使用下面这组命令# 列出所有已拉取的模型 ollama list # 查看模型配置、参数、量化方式 ollama show deepseek-r1:8b # 删除不再需要的模型 ollama rm deepseek-r1:13bollama show里能看到modelfile内容、parameters、context length等关键信息。排查问题时先确认模型是否真的在本地再检查ollama list显示的体积是否与预期一致比盲目重新拉取更有效率。如果磁盘空间开始吃紧优先删除不常用的 13B 或 33B 版本保留 8B 作为日常主力。4. Cherry StudioUI 对话与本地知识库的落地方式4.1 为什么命令行跑通之后还要桌面客户端ollama run的交互模式适合快速测试模型能力但真要拿来做日常工作短板很明显没有多会话管理上下文一长终端就变得难以阅读也没有可视化的参数调节面板。Cherry Studio 这类桌面客户端的价值在于它把 Ollama 的模型服务包装成类似商业 AI 产品的界面同时保留本地存储对话记录不上传第三方服务器。它支持 OpenAI 兼容接口可以直接识别本地 Ollama 服务。这种做法在实际开发中很常见先让模型能力跑通再套一层 UI 或 API 网关后续换模型或接别的厂商只要接口规范不变界面层不用动。Cherry Studio 还内置了知识库模块这也是很多用户部署本地大模型的核心诉求——用一个不依赖云端的工具处理内部文档问答。4.2 接入 Ollama 的配置参数打开 Cherry Studio 后进入设置找到模型服务列表选择 Ollama 类型。需要填写的核心参数只有两个接口地址和模型名称。配置项值API 地址http://127.0.0.1:11434模型名称deepseek-r1:8b服务类型Ollama填完后先点连接测试通过后保存。此时对话窗口里的模型下拉框会出现deepseek-r1:8b选择它即可开始对话。如果遇到连接失败先回到命令行执行ollama list确认服务仍在运行再确认 Cherry Studio 没有把请求发到https://开头的远程地址。这里有一个实际工作中的细节如果你同时配置了多个模型服务Cherry Studio 允许为每个会话单独指定模型。比如用 deepseek-r1:8b 做代码生成用 7b 版本做短文本分类切换成本很低不需要反复启动新服务。4.3 本地知识库的索引构建知识库是本地的文档切片 向量化检索再把检索结果和用户问题一起交给大模型回答。Cherry Studio 本身不自带嵌入模型需要你在 Ollama 中额外拉取一个轻量级 Embedding 模型常见的选择是nomic-embed-textollama pull nomic-embed-text然后在 Cherry Studio 的知识库页面新增一个知识库选择刚刚拉取的模型作为向量化引擎。上传文档后系统会按照块大小和重叠范围进行切片。我一般把 chunk_size 设置为 500 字符chunk_overlap 设置为 50 字符。前一个参数决定每段文本的长度过大会导致检索粒度粗过小会让上下文碎片化重叠部分则是为了保留段落之间的语义衔接。这些参数在首次建立索引时生效如果之后修改需要重新构建索引。判断知识库是否生效可以在对话中主动引用文档里的原话如果回答明显偏离优先检查 Embedding 模型是否成功加载以及文档是否需要分页。不要忽略ollama list里是否同时存在deepseek-r1:8b和nomic-embed-text两个模型缺少任何一个都会导致知识库问答失败。5. 让本地 DeepSeek 服务更适合日常使用5.1 局域网访问与安全边界默认情况下 Ollama 只监听本机回环地址其他设备无法访问。如果团队需要共用一台配置较好的机器上的 DeepSeek 模型可以修改OLLAMA_HOSTexport OLLAMA_HOST0.0.0.0:11434 ollama serve修改后同一局域网内的设备可以通过http://主机IP:11434访问。这个方式很适合团队内部把模型作为共享服务但要注意Ollama 本身没有鉴权机制暴露到局域网意味着任何人都能调用模型消耗机器资源。更稳妥的做法是放在内网隔离网段外包一层 Nginx 做访问控制不要直接暴露到公网。5.2 用 Modelfile 固定系统提示与推理参数每次在 Cherry Studio 或终端里手动调温度、top_p 不是长久之计Ollama 允许通过 Modelfile 定义一个带默认参数和系统提示的模型版本。创建一个名为Modelfile的文本文件FROM deepseek-r1:8b PARAMETER temperature 0.6 PARAMETER top_p 0.9 PARAMETER num_ctx 8192 SYSTEM 你是一个代码审阅助手回答要指出具体问题和修改位置。保存后执行ollama create my-deepseek -f ./Modelfile再通过ollama run my-deepseek启动。此时模型名称和基础模型区分开参数已经固化在定义里不需要每次重复输入。num_ctx决定上下文窗口大小默认 2048 在长文本解析时经常不够用如果你发现模型“忘记”了前文内容第一件事就是把num_ctx调大并确认机器有足够内存承载更大的上下文占用。5.3 通过 API 做连通性验证界面能聊不代表 API 接口稳定。部署完成后用 curl 直接访问推理服务可以快速定位问题到底出在模型本身还是客户端配置。curl -H Content-Type: application/json http://localhost:11434/api/generate -d { model: deepseek-r1:8b, prompt: 用一句话解释什么是 num_ctx。, stream: false }这段请求会输出完整响应里面包含total_duration、load_duration、eval_count等字段。total_duration是总耗时eval_count是生成的 token 数两者相除可以算出实际推理速度。如果你的应用对接 OpenAI SDK也可以把 base_url 改成http://localhost:11434/v1这是 Ollama 提供的 OpenAI 兼容端点模型名填入deepseek-r1:8b即可复用现有代码。本文还有配套的精品资源点击获取
返回列表