在 Oracle ARM 2C/12G 服务器上部署 LFM2.5-2.6B:Ollama + 远程 Agent

本文记录一次完整的部署过程:在 ARM64、2 核 CPU、12GB 内存、无 GPU 的服务器上,通过 1Panel + Docker Compose 部署 Ollama 0.33.1,运行 Liquid AI LFM2.5-2.6B Q4_K_M,并通过 OpenAI 兼容 API 提供给本地电脑上的第三方 Agent 使用。

一、环境

  • CPU:ARM64 / Ampere Neoverse-N1,2 Core
  • 内存:12GB
  • GPU:无
  • 系统:Ubuntu
  • 面板:1Panel
  • Ollama:0.33.1
  • 模型:LFM2.5-2.6B
  • 量化:Q4_K_M

这套配置适合运行 2.6B 级量化模型,更适合单用户、低并发的常驻 API 服务。


二、通过 1Panel 部署 Ollama

在 1Panel 应用商店中安装 Ollama

  • 部署方式:Docker Compose
  • 版本:0.33.1
  • 架构:确保使用 ARM64 / aarch64 镜像
  • GPU:无需配置
  • 端口:11434
  • 数据目录:建议使用持久化目录

安装完成后进入 Ollama 容器终端,检查:

1
ollama --version

三、下载并启动 LFM2.5-2.6B

不要直接执行:

1
ollama run lfm2.5

因为官方 Ollama 库中的 lfm2.5 并不是这里需要的 2.6B 版本。

直接运行 Liquid AI 官方 GGUF 的 Ollama 版本:

1
ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M

首次运行会自动下载并加载模型。

下载完成后检查:

1
ollama list

正常应看到类似:

1
2
NAME                                      ID              SIZE      MODIFIED
hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M 26d07caa2ddb 1.7 GB ...

测试模型:

1
ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M

输入:

1
你好,介绍一下你自己。

能正常回答即可。


四、确认模型信息

执行:

1
ollama show hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M

重点确认:

1
2
3
4
architecture        lfm2
parameters 2.7B
context length 131072
quantization Q4_K_M

并确认能力包含:

1
2
3
tools
thinking
completion

这里的 131072 是模型理论上下文长度,并不代表 12GB 内存服务器应该直接开到 131K。实际使用建议从 4096~8192 开始。


五、确认 Ollama API 正常

服务器本机执行:

1
curl http://127.0.0.1:11434/v1/models

正常会返回模型列表,例如:

1
2
3
4
5
6
7
8
9
{
"object": "list",
"data": [
{
"id": "hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M",
"object": "model"
}
]
}

这说明 Ollama 的 OpenAI 兼容 API 已经正常工作。


六、开放远程访问

如果要让本地电脑上的 Agent 访问服务器,需要让 Ollama 接受远程连接。

Docker Compose 中设置:

1
2
environment:
- OLLAMA_HOST=0.0.0.0:11434

重启 Ollama 后检查:

1
ss -lntp | grep 11434

确认不再只监听 127.0.0.1:11434,而是监听远程地址。

同时放行服务器的 11434 端口(Oracle 安全规则 / NSG,以及系统防火墙,按实际环境配置)。

安全提醒: Ollama 默认并不等于公网鉴权服务。测试完成后,不建议长期把 11434 裸露在公网。长期使用建议改成 SSH 隧道、Tailscale、VPN 或其他访问控制方案。


七、从 Windows 验证远程 API

先在本地 PowerShell 7 中测试模型列表:

1
curl.exe http://服务器IP:11434/v1/models

然后直接测试聊天接口:

1
2
3
curl.exe http://服务器IP:11434/v1/chat/completions `
-H "Content-Type: application/json" `
-d '{"model":"hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M","messages":[{"role":"user","content":"你好"}],"stream":false}'

PowerShell 里的常见坑

PowerShell 7 使用单引号包裹整个 JSON 时,内部双引号不需要写成 \"

错误写法会导致:

1
invalid character '\\' looking for beginning of object key string

正确写法就是上面的命令。

如果能正常返回模型回复,说明:

1
Windows → 公网 IP → Ollama → LFM2.5-2.6B

整条链路已经打通。


八、接入本地 Agent

第三方 Agent 只要支持 OpenAI Compatible API,一般填写:

1
2
3
4
5
6
7
8
Base URL:
http://服务器IP:11434/v1

Model:
hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M

API Key:
ollama

注意:不同 Agent 对 Base URL 的处理方式不同。有些 Agent 会自动补 /v1/chat/completions,不要把完整接口地址重复填进去。

实际部署中,曾出现 Agent 报 400,但服务器端 /v1/models/v1/chat/completions 均正常,最终确认是 Agent 本身的配置问题,不是 Ollama 或模型故障。


九、最终部署结构

1
2
3
4
5
6
7
8
9
10
11
本地 Windows

└── 第三方 Agent

│ OpenAI Compatible API

Oracle ARM 2C / 12GB

└── Docker / Ollama 0.33.1

└── LFM2.5-2.6B Q4_K_M

十、建议配置

对于 2 Core / 12GB 的 ARM 服务器,建议先保持:

  • 单用户 / 单 Agent 为主
  • Context:40968192
  • 量化:Q4_K_M
  • 不要一开始尝试 131072 上下文
  • 不建议同时运行大量并发推理任务

这样可以把有限的 CPU 和内存优先留给模型推理。


总结

最终方案非常简单:

1
2
3
4
5
6
7
8
9
1Panel

Ollama 0.33.1

LFM2.5-2.6B Q4_K_M

Ollama OpenAI Compatible API

本地 Agent

整套部署不需要 GPU,也不需要 Box64;ARM64 服务器直接运行 Ollama 即可。