本地语言模型¶
OpenAI 仍是默认后端;本地推理需要用户明确选择。科学工具、LangGraph、skills、 任务记忆、多任务链接和审阅机制继续共用。内置优先使用 Ollama;显式指定的 Hugging Face 仓库若没有已审核的 Ollama 对应项,则读取官方模型卡及配置,固定 模型提交版本,使用 Hugging Face 官方 Transformers 本地服务。该兼容运行时 按需安装在用户选定的 Python 环境;安装前须检查依赖兼容性。
并非所有 Hugging Face 模型都可运行。架构、量化内核、工具调用、上下文和硬件 都必须兼容;不会自动执行仓库自定义代码。官方要求 vLLM/SGLang 等特殊方案的 模型,可按其模型卡部署,再通过私有兼容接口接入。运行失败不会盲目更换模型或 转用云端。Ollama 标签不能可靠反推 HF 仓库,需要用户给出官方仓库 ID。
安装与选择¶
无论最初安装时选择外部 API 还是本地模型,之后都可以在 Web 工作台的模型菜单中
打开管理本地模型。经过审核的模型库会先按当前硬件、可用内存/显存及磁盘空间
筛查;不适合本机的模型仍会显示,但保持灰色并说明原因。权重自动存入安装时指定的
用户信息总目录下的 models/ 子目录,不会占用或混入科研数据目录。
多个符合条件的模型可以同时下载。暂停会关闭该模型当前的拉取流,同时保留独立暂存 服务和已经校验的分片;继续会通过同一暂存服务在原分片上续传;放弃会停止暂存服务、 只删除该模型的未完成文件,并恢复为 未安装状态。关闭管理对话框不会停止下载,模型小菜单继续显示适配后的进度和控制。 下载结束后,系统在本机做不加载科研推理的清单/能力检查,并显示绿色完成标记;用户 点击选择该模型后,标记在两个界面同步消失,Web 会按需启动安装所拥有的 Ollama 服务。 原有云端 key、云端模型配置和对话不会被覆盖。
macOS/Linux 安装脚本支持可选本地模型安装,必须指定源码之外的绝对用户信息目录,模型存于其 models/ 子目录:
./scripts/install_liquid_agent_cli.sh --user-data-dir "$HOME/Liquid Agent Data" --with-local-models
Windows 在已激活的 Python 3.12 / Node.js 环境中运行:
.\scripts\install_liquid_agent_cli.ps1 -UserDataDir "D:\Liquid Agent Data" -WithLocalModels
已安装用户可以先查看不下载权重的硬件计划,再执行安装:
liquid-agent local-models hardware
liquid-agent local-models setup --models-dir "$HOME/Liquid Agent Data/models" --dry-run
liquid-agent local-models setup --models-dir "$HOME/Liquid Agent Data/models" --install-runtime
liquid-agent local-models serve
HF 模型使用 liquid-agent local-models serve --runtime transformers 启动。
保持相应终端开启;Ctrl+C 停止服务。关闭最后一个 Web 工作台页面也会停止
Liquid Agent 托管的 Ollama;独立启动的 Ollama 不受影响。默认端口分别是 11435 和 11436。
安装完成不会改变原先云端模型和 key。Web 管理窗口只显示紧凑的模型列表;点击下载后,
系统自动完成存放、检查和配置,用户不需要填写模型地址、端口或上下文参数。
准备阶段显示动态细线,下载时显示主题色进度;暂停保留分片,继续续传,放弃删除分片。
点击已安装模型即可使用;绿色圆圈勾号会在管理窗口和小菜单中一起消失。
关闭管理窗口会保留模型小菜单。下载资格依据设备总容量和磁盘空间,其他程序暂时占用
内存不会禁用 4B 下载按钮;真正超出容量的模型会说明原因。
自定义私有服务器仍可通过 CLI 或本地 API 配置,既有配置不会被删除。CLI 可使用
liquid-agent local-models use <profile-id> 或 /llm use local <profile-id>。
使用 --models-list /path/models.json 指定多个模型,格式参见上方英文示例。
没有已审核 Ollama 映射的 HF 仓库自动走官方 Transformers 路径;如希望已映射
模型也用原始 HF 权重,设置 "runtime": "transformers"。
未知 Ollama 模型需要提供 weights_gib 和 working_gib;没有足够信息的模型
会明确跳过,不猜测、不先下载。安装报告保存在模型目录的
liquid-local-install-report.json。失败下载或探测留下的缓存不会擅自删除。
Qwen 使用 32K 配置和以下容量估计:16GB Apple Silicon → Qwen3.5 4B,32GB Apple Silicon → Qwen3.5 9B,空闲显存足够的 32GB NVIDIA → Qwen3.8 27B。 Muse 使用单独的 64K 配置。这些只是容量估计;同时使用完整工具目录和多张图片时, 应观察内存占用,并在设备容量范围内调整上下文及输出预算。安装探测只确认基本工具 往返,不能替代对图片理解、科学准确性和长任务可靠性的实际评估。
Meta Muse Glimmer 30B¶
官方仓库为
meta-models/Muse-Glimmer-30B。
按 Meta 的 Ollama 部署说明,
沿用现有接口即可支持。显式选择这个仓库时,安装计划会选择
muse-glimmer:30b-q4_K_M 文本/图像量化版;不会更改默认推荐、当前模型或已有 key。
仓库提供 configs/local-models-muse.json,配置名称为 muse。在仓库目录运行,
把存储位置换成目标设备上的绝对路径:
liquid-agent local-models setup --models-dir "$HOME/Liquid Agent Data/models" --models-list configs/local-models-muse.json --dry-run
liquid-agent local-models setup --models-dir "$HOME/Liquid Agent Data/models" --models-list configs/local-models-muse.json --install-runtime
liquid-agent local-models serve
保留服务终端,在另一终端运行 liquid-agent local-models probe muse,通过后用
liquid-agent local-models use muse 明确选用,再运行 liquid-agent 打开 Web。
也可以把 --models-list ... 换成 --model meta-models/Muse-Glimmer-30B,
此时配置名称由安装计划生成。底层仍以 liquid-muse-glimmer-…:managed 作为绑定上下文的
服务别名,但 Web/CLI 菜单显示 Muse Glimmer 30B。Qwen 托管配置同样显示
Qwen 3.5 4B 等易读名称;自定义配置可在管理界面填写或修改显示名称。
量化权重连同图像编码器约 17 GiB;64K 上下文的工作内存估计为 22 GiB。
16GB Mac 会在下载前跳过;32GB Apple Silicon 或空闲显存足够的 32GB NVIDIA
设备是估算的容量候选。图片、长上下文、其他科学计算仍可能使内存不足。
原始 HF BF16 权重约 55.5 GiB;显式设置 runtime: transformers 或 HF revision
会保留原始检查点并单独检查容量,不会偷偷改成量化版。
安装前要求稳定版 Ollama 0.32.7 或更新。默认 65,536 上下文、8,192 输出预算、 900 秒超时,temperature 1.0、top-p 0.95、high reasoning;top-k 64 继承自 官方 Ollama 模型。64K 为完整科学工具目录、工作区上下文、多图和推理输出保留空间; 容量估算以该上下文为基准,更长上下文会进一步提高内存要求。 不会自动选择 MLX/DFlash 版本,也不会把 3B drafter 当作完整模型。 模型支持文图输入和工具调用,但安装探测不代表已经确认真实模型的读图、 科学准确性或长任务能力。正式使用前请在自己的目标机器上评估这些能力。
隐私与运行边界¶
本地配置单独保存在用户配置目录的 local_models.json,不进入项目源码。API key 使用系统凭据库
主密钥认证加密,凭据库不可用不回退明文。高级 Transformers 依赖装入用户选定的 Python,
不另建 venv;需与所选环境已有科学依赖核对版本。
托管 Ollama 关闭云端模式,HF 服务使用离线和禁用遥测设置;本地 HTTP 请求不
继承代理、不跳转到公网,也不继承 OpenAI/Gemini 的 key。私有服务器仍需由
部署者确认没有转发到外部服务。整个软件的文献检索等联网工具需要另行管理。
连接直接使用已经检查过的私网 IP,保留原 HTTP Host 与 TLS 服务名,避免检查后
再次解析域名造成绕过。更新或撤销本地认证会中止旧连接;本地配置损坏会明确
提示修复,不会连带关闭 GPT/Gemini 的选择入口。
Web API 在执行前拒绝外站来源和伪造域名。公开门户不会探测本地 API;Try it
直接打开安装文档。托管 HF 服务拒绝网页直接调用。这些保护不代替用户认证,请保持应用绑定本机;
局域网推理服务器仍需单独配置访问控制。
如需要严格离线,应先下载依赖和模型,再限制系统出站网络并观察实际流量。
仅凭框架的离线设置不能声称绝对不会上传。