在 Oracle ARM 2C/12G 服务器上部署 LFM2.5-2.6B:Ollama + 远程 Agent
在 Oracle ARM 2C/12G 服务器上部署 LFM2.5-2.6B:Ollama + 远程 Agent
clover本文记录一次完整的部署过程:在 ARM64、2 核 CPU、12GB 内存、无 GPU 的服务器上,通过 1Panel + Docker Compose 部署 Ollama 0.33.1,运行 Liquid AI LFM2.5-2.6B Q4_K_M,并通过 OpenAI 兼容 API 提供给本地电脑上的第三方 Agent 使用。
一、环境
- CPU:ARM64 / Ampere Neoverse-N1,2 Core
- 内存:12GB
- GPU:无
- 系统:Ubuntu
- 面板:1Panel
- Ollama:0.33.1
- 模型:
LFM2.5-2.6B - 量化:
Q4_K_M
这套配置适合运行 2.6B 级量化模型,更适合单用户、低并发的常驻 API 服务。
二、通过 1Panel 部署 Ollama
在 1Panel 应用商店中安装 Ollama:
- 部署方式:Docker Compose
- 版本:
0.33.1 - 架构:确保使用 ARM64 / aarch64 镜像
- GPU:无需配置
- 端口:
11434 - 数据目录:建议使用持久化目录
安装完成后进入 Ollama 容器终端,检查:
1 | ollama --version |
三、下载并启动 LFM2.5-2.6B
不要直接执行:
1 | ollama run lfm2.5 |
因为官方 Ollama 库中的 lfm2.5 并不是这里需要的 2.6B 版本。
直接运行 Liquid AI 官方 GGUF 的 Ollama 版本:
1 | ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M |
首次运行会自动下载并加载模型。
下载完成后检查:
1 | ollama list |
正常应看到类似:
1 | NAME ID SIZE MODIFIED |
测试模型:
1 | ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M |
输入:
1 | 你好,介绍一下你自己。 |
能正常回答即可。
四、确认模型信息
执行:
1 | ollama show hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M |
重点确认:
1 | architecture lfm2 |
并确认能力包含:
1 | tools |
这里的 131072 是模型理论上下文长度,并不代表 12GB 内存服务器应该直接开到 131K。实际使用建议从 4096~8192 开始。
五、确认 Ollama API 正常
服务器本机执行:
1 | curl http://127.0.0.1:11434/v1/models |
正常会返回模型列表,例如:
1 | { |
这说明 Ollama 的 OpenAI 兼容 API 已经正常工作。
六、开放远程访问
如果要让本地电脑上的 Agent 访问服务器,需要让 Ollama 接受远程连接。
Docker Compose 中设置:
1 | environment: |
重启 Ollama 后检查:
1 | ss -lntp | grep 11434 |
确认不再只监听 127.0.0.1:11434,而是监听远程地址。
同时放行服务器的 11434 端口(Oracle 安全规则 / NSG,以及系统防火墙,按实际环境配置)。
安全提醒: Ollama 默认并不等于公网鉴权服务。测试完成后,不建议长期把
11434裸露在公网。长期使用建议改成 SSH 隧道、Tailscale、VPN 或其他访问控制方案。
七、从 Windows 验证远程 API
先在本地 PowerShell 7 中测试模型列表:
1 | curl.exe http://服务器IP:11434/v1/models |
然后直接测试聊天接口:
1 | curl.exe http://服务器IP:11434/v1/chat/completions ` |
PowerShell 里的常见坑
PowerShell 7 使用单引号包裹整个 JSON 时,内部双引号不需要写成 \"。
错误写法会导致:
1 | invalid character '\\' looking for beginning of object key string |
正确写法就是上面的命令。
如果能正常返回模型回复,说明:
1 | Windows → 公网 IP → Ollama → LFM2.5-2.6B |
整条链路已经打通。
八、接入本地 Agent
第三方 Agent 只要支持 OpenAI Compatible API,一般填写:
1 | Base URL: |
注意:不同 Agent 对 Base URL 的处理方式不同。有些 Agent 会自动补 /v1/chat/completions,不要把完整接口地址重复填进去。
实际部署中,曾出现 Agent 报 400,但服务器端 /v1/models 和 /v1/chat/completions 均正常,最终确认是 Agent 本身的配置问题,不是 Ollama 或模型故障。
九、最终部署结构
1 | 本地 Windows |
十、建议配置
对于 2 Core / 12GB 的 ARM 服务器,建议先保持:
- 单用户 / 单 Agent 为主
- Context:
4096~8192 - 量化:
Q4_K_M - 不要一开始尝试
131072上下文 - 不建议同时运行大量并发推理任务
这样可以把有限的 CPU 和内存优先留给模型推理。
总结
最终方案非常简单:
1 | 1Panel |
整套部署不需要 GPU,也不需要 Box64;ARM64 服务器直接运行 Ollama 即可。