一、安装 LM Studio
1 | # 一键安装(自动识别 ARM64) |
二、启动 llmster 守护进程
1 | lms daemon up |
三、下载 Qwen3.8-27B Q4_K_M 模型
1 | # 下载 unsloth 量化的 GGUF 仓库 |
如果想只下载 Q4_K_M 单个文件(约 16-18GB),用这个:
1 | pip install -U huggingface_hub |
四、加载模型
1 | # 查看已下载的模型,确认模型 ID/路径 |
五、启动 API 服务器(端口 8000,允许局域网访问)
1 | lms server start --bind 0.0.0.0 --port 8000 |
验证监听地址:
1 | sudo ss -tlnp | grep 8000 |
看到 0.0.0.0:8000 即为正常。
六、防火墙放行(如需要)
1 | # Ubuntu ufw 防火墙 |
七、测试调用
7.1 在 GB10 本机测试
1 | # 查看可用模型 |
7.2 从另一台主机远程调用
1 | # 把 <GB10的IP> 换成实际 IP,例如 192.168.1.100 |
model字段填lms list里显示的模型名称即可,也可以直接用模型文件名。
八、交互式对话(可选)
1 | lms chat |
九、常用管理命令
| 操作 | 命令 |
|---|---|
| 查看服务状态 | lms status |
| 停止服务器 | lms server stop |
| 关闭守护进程 | lms daemon down |
| 查看已下载模型 | lms list |
| 查看运行中的进程 | lms ps |
核心流程就五步:安装 → lms daemon up → lms get 下载模型 → lms load 加载 → lms server start --bind 0.0.0.0 --port 8000 启动服务,然后用 curl 或任意 OpenAI 兼容客户端调用即可。

