本文介绍了如何在30分钟内使用Ollama平台部署Qwen3.8-27B模型,并利用RTX 4090显卡进行全程运行。通过Open WebUI的Docker命令和Python客户端的base_url修改,实现了本地模型调用,并成功将Claude Code替换为本地模型,无需接触Anthropic服务。文章详细阐述了硬件要求、安装步骤、参数设置以及常见问题解决方案,并提供了性能测试数据和未来扩展方向。


Ollama + Open WebUI + Python 客户端 + Claude Code 改 BaseURL · 一张 4090 全程跑

Qwen3.8-27B 在 Ollama 上跑通到接 Claude Code 改 BaseURL,全程 30 分钟。 一张 RTX 4090 拉 Q4 量化版 17-18GB,Ollama 一行命令,Open WebUI 一个 Docker 命令,Python 客户端改个 base_url 就能调,最后把 Claude Code 替换成本地模型。中间不碰 Anthropic 服务,代码完全不出本机。

硬件门槛:先看你的卡够不够

Q4 量化版模型权重约 17-18GB,推理时还要给 KV Cache 留 3-5GB,这是硬门槛。 社区实测:RTX 4090 24GB 显存跑得最舒服,RTX 4060 Ti 16GB 也能流畅跑,Mac M4 Max 24GB+ 统一内存也 OK。8GB 或 12GB 显存的卡就别试了,模型文件本身就装不下。

显卡显存Q4 量化版推荐度
RTX 4090 / 509024GB+完全没问题首推
RTX 4060 Ti 16GB16GB流畅(推荐配置)甜点
RTX 3090 / 4070 Ti SUPER16-24GB可跑(短上下文)可用
RTX 3060 / 407012GB边缘可跑(必须短上下文)勉强
Mac M4 Max24-128GB 统一内存流畅推荐
8GB 显存或纯 CPU不可行别试

系统内存建议 32GB+。 显存不够时 Ollama 会用 RAM 做 Swap,内存太小会直接 OOM 崩溃。Windows 跑 Ollama 建议用 WSL2 环境(WSL2 是 Windows 下的 Linux 子系统,Docker 跑 Open WebUI 也更顺)。Mac 选 Apple Silicon 版本,能用 M 系列芯片的统一内存。

第一步:装 Ollama,2 分钟

# macOS / Linux 一行装
curl -fsSL https://ollama.com/install.sh | sh
# Windows 装:去 ollama.com/download 下载安装包
# 双击安装,下一步到底
# 装完验证
ollama --version

第二步:拉 Qwen3.8-27B,10-20 分钟

# 默认 Q4 量化版,约 17-18GB(推荐)
ollama pull qwen3.8:27b
# 如果你有 48GB+ 显存,想要更高精度
ollama pull qwen3.8:27b-q8_0
# Apple Silicon Mac 专版(用 MLX 加速)
ollama pull qwen3.8:27b-mlx

网络好的话 10 分钟搞定,一般留 20 分钟。 拉完用 ollama list 看模型是否到位。第一次跑会从磁盘读模型到显存,启动约 5-10 秒,这段时间别慌。

上下文窗口别用默认的。 Ollama 默认只给几千 tokens 上下文,长文本会被静默截断:模型看起来像忘了你的文档,其实是被截了。用长文档前先设:

# 进入对话后设置
ollama run qwen3.8:27b
/set parameter num_ctx 32768
# 或者 API 调用时传
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8:27b",
"messages": [{"role": "user", "content": "用 Python 写一个快速排序"}]
}'

第三步:跑通对话,验证模型活着

# 直接命令行对话
ollama run qwen3.8:27b
# 试一句:
>>> 你好,介绍下你自己
# 退出会话
>>> /bye

第四步:装 Open WebUI,3 分钟

Open WebUI 是 Ollama 的官方推荐 Web 前端,类似 ChatGPT 的聊天界面。 跑这一步要 Docker。没装先去 docker.com 下载 Docker Desktop。

# 一行起 Open WebUI(需 Docker)
docker run -d -p 3000:3000 \
-e OLLAMA_BASE_URL=http://host.docker.internal:11434 \
--name open-webui \
ghcr.io/open-webui/open-webui
# 浏览器访问 http://localhost:3000
# 第一次进要注册账号,存在本地 SQLite 里

进去后在模型下拉框选「Qwen3.8 27B」就能开始聊天。这层是给人用的,调试 prompt、看对话历史、看 token 消耗,都比命令行方便。 周末居家实操,用这个最顺手。

第五步:Python 客户端调用,5 分钟

Ollama 自带 OpenAI 兼容 API 端点,路径是 http://localhost:11434/v1。 任何用 OpenAI Python SDK 写的代码,只需要改一个 base_url 就能切到本地模型,不用改业务逻辑。

# 装 openai SDK
pip install openai
# 写一个本地 Python 助手
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1", # 关键:换成本地
api_key="ollama" # 任意值,Ollama 不校验
)
resp = client.chat.completions.create(
model="qwen3.8:27b",
messages=[
{"role": "system", "content": "你是一个 Python 助手,给出可运行代码"},
{"role": "user", "content": "写一个读取 CSV 统计每列均值的脚本"}
],
temperature=0.3
)
print(resp.choices[0].message.content)

第六步:接 Claude Code,零 API 费用

这步是省 token 钱的关键:把 Claude Code 的请求转给本地 Qwen,代码完全不出本机。 Claude Code 走的是 Anthropic 协议,但只要换 BASE_URL 指向 Ollama 暴露的 OpenAI 兼容端点,就能用本地模型替代。

# Mac / Linux 临时设置(关掉终端就失效)
export ANTHROPIC_BASE_URL=http://localhost:11434/v1
export ANTHROPIC_AUTH_TOKEN=ollama
# Windows PowerShell 临时设置
$env:ANTHROPIC_BASE_URL="http://localhost:11434/v1"
$env:ANTHROPIC_AUTH_TOKEN="ollama"
# 启动 Claude Code
ollama serve # 另一个终端窗口保持运行
claude # 启动 Claude Code

永久生效:写入配置文件。 临时设置关掉终端就失效,日常用建议写进 settings.json。

# 路径(按系统选)
# macOS / Linux: ~/.claude/settings.json
# Windows: ~/.claude/settings.json(不同系统位置略不同,详见 Claude Code 官方文档)
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434/v1",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}

踩坑清单:30 分钟里最容易卡住的地方

  1. 拉模型时网络慢。 Ollama 默认从官方源拉,国内网络可能卡。解决:用国内代理,或者改用 modelscope.cn 手动下载 GGUF 文件再让 Ollama 加载。

  2. 模型「忘了」你的长文档。 不是 bug,是 Ollama 默认上下文被截短了。每次跑前 /set parameter num_ctx 32768,或者在 API 调用里传 num_ctx。

  3. Windows 下 CUDA 报错。 Ollama 自动检测 CUDA,但版本不对会强制 CPU 推理(速度慢 10 倍)。检查 NVIDIA 驱动 ≥ 545,CUDA ≥ 12.1。

  4. Open WebUI 看不到模型。 Docker 容器内访问宿主机 Ollama 走 host.docker.internal:11434,不是 localhost。环境变量 OLLAMA_BASE_URL 必须明确指定。

  5. Claude Code 还要求登录。 检查 ANTHROPIC_BASE_URL 是否生效,Ollama 是否在跑(curl http://localhost:11434 看回不回字符串)。两个都 OK 但还是登,清掉 ~/.claude/settings.json 里的旧 token 重试。

性能实测:4090 上跑得动吗

速度参考(社区实测数据,硬件不同会浮动): RTX 4090 跑 Q4 量化版约 60-80 tokens/s;RTX 4060 Ti 16GB 约 25-30 tokens/s;Mac M4 Max 24GB 统一内存约 30-50 tokens/s。这个速度日常对话、读代码、写脚本完全够用,瓶颈只在首 token 延迟, KV Cache 预热 1-2 秒。

再补一个实测量级数据: 长上下文是隐形杀手。512 tokens 约 1.5GB KV Cache,2048 tokens 跳到 6GB,8192 tokens 直接 24GB。24GB 显存的 4090 开 32K 上下文已经很紧张,开满 262K 必然爆。 日常用设 8K-32K 就够,超长的场景换 vLLM 多卡。

最后

对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?

答案只有一个:人工智能(尤其是大模型方向)

当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右

再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!

下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

在这里插入图片描述

1、大模型学习路线

2、从0到进阶大模型学习视频教程

从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、 AI大模型最新行业报告

2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范
第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署
第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建
第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型

  • 带你了解全球大模型

  • 使用国产大模型服务

  • 搭建 OpenAI 代理

  • 热身:基于阿里云 PAI 部署 Stable Diffusion

  • 在本地计算机运行大模型

  • 大模型的私有化部署

  • 基于 vLLM 部署大模型

  • 案例:如何优雅地在阿里云私有部署开源大模型

  • 部署一套开源 LLM 项目

  • 内容安全

  • 互联网信息服务算法备案

  • 👇👇扫码免费领取全部内容👇👇

    在这里插入图片描述

3、这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

在这里插入图片描述

更多推荐