🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

loonylabs-dev/strix-halo-inference

DeepSeek Harnessspec-screened扫描:无法判定在 GitHub 查看 ↗
需源码安装

一台经过实测的 Strix Halo…

暂不能直接安装(需源码编译或环境不满足):仓库缺少 package.json,无法用 dsh 插件安装命令安装。 · 最近上游提交 2026/9/25 · 已提供中文文档

为 Strix Halo(Ryzen AI Max+ 395,128 GB)实测的推理栈——llama.cpp 服务,加上 TTS/TTI/TTV 媒体工作负载,统一在一个内存管理之下。不是分支:master 加上一小组补丁。内存预算、缺陷登记表、前缀缓存网关。

综合分
33.6
GitHub 分
33.6
用户评分
—
★ Stars
5
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add loonylabs-dev/strix-halo-inference
仓库缺少 package.json,无法用 dsh 插件安装命令安装,改用 GitHub 源安装
信任档位:已验证本站已于 4 天前真实安装成功(L4 · 真实安装)
是什么
dsh 原生插件 · market
装得上吗
本站已真实安装成功(L4 · 真实安装,非静态推断)
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
活跃:最近一次提交在 1 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

🟢实装验证通过· 2026/9/22
由本站实装验证器在真实 dsh 环境安装成功,非静态推断。
数据截至 2026/9/25(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查需源码安装

以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。

✗npm 包strix-halo-inference(未发布到 npm,仅可源码安装)
✓Node 引擎未声明 engines.node
✓dsh CLI 依赖未声明 dsh 版本约束
✗入口文件缺少入口声明

仓库缺少 package.json,无法用 dsh 插件安装命令安装

验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/20 11:28:10

用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
strix-halo-inference

tests
license
GPU
RAM
backend
python

一台经过实测的 Strix Halo 推理机器:一个投入生产使用的本地编码智能体——以及在同一内存管辖下的文生图、语音和视频。 一种配置——Ryzen AI Max+ 395(gfx1151),128 GB 共享内存——这里的每一个数字都是在该配置上测得的,并附有日期和方法。

bash setup/preflight.sh              # is this repo for your machine?
bash setup/install.sh                # once — writes ~/.config/llm-stack.env
bash setup/switch-model.sh halogen-qwen38flash # (alias: halogen) serve the high-speed Halogen container
or: bash setup/switch-model.sh halogen-qwen38  # serve 27B via Halogen
or: bash setup/switch-model.sh qwen38         # serve GGUF via llama-server
bash tests/run.sh                    # the gate (1529 tests, ~20 s, no GPU)

你拉取的名称就是你服务的名称。这里没有 pull 命令,因为一个模型就是它在 setup/env/ 中的配置文件——而该配置文件承载了权重来自何处、一个上下文 token 在 KV 中的开销,以及其命令行上每个标志背后的实测依据。

这适合你的机器吗?

bash setup/preflight.sh 在五秒内给出答案,无需 root,不做任何更改:

| RAM | 按原样可用的配置文件 |
|---|---|
| 128 GB | 7 个中的 7 个——这里所有内容都是在该配置上实测的 |
| 64 GB | 7 个中的 3 个——batch、gemma26、gemma31 |
| 32 GB | 一个都不行:17.6 权重 + 6.0 缓冲下限 + 12 主机内存已经超了 |

不会为了改变这一点而做任何缩减——缩减后的数字只是猜测。这不是一个通用技术栈,这是有意为之;preflight.sh 会在你花掉一个下午之前告诉你所处的位置。

引擎:Strix Halo 上的开箱即用性能

无需再与 ROCm 编译标志或手动容器挂载较劲,本技术栈为该芯片上最快的推理引擎提供了开箱即用的配置:

* Halogen Flash Server(setup/halogen/):一个无 root 容器后端,运行 Qwen 3.8 Flash-Next 并采用 MTP 推测解码——在这里投入生产用于日常智能体工作。2026 年 9 月 24 日在 0.13.8 上实测:一个 186k token 的冷提示词在 192 秒内完成(约 970 tok/s),从 2k 到 193k 上下文,长回答速度为 31-34 tok/s。它的提示词缓存存在于 RAM 以及 NVMe 中:
一次被逐出的深度对话,或一次重启后幸存的对话,会在
2-3 秒内恢复,而不是约 3 分钟
(报告)。
* llama.cpp(setup/scripts/build-llama.sh):
上游 master 加上一小组精选的硬件补丁
(setup/patches/),以支持广泛的 GGUF 模型
生态。

在它们之间切换只需一条命令:

bash setup/switch-model.sh halogen-qwen38flash # 切换到 Halogen Flash Server(或:halogen)
bash setup/switch-model.sh halogen-qwen38      # 切换到 Halogen Server(27B)
bash setup/switch-model.sh qwen38              # 切换回 llama.cpp

网关完全屏蔽了你的客户端:更换底层引擎
无需在你的编辑器或工具链中做任何配置更改。

网关:通用接口与即时轮次

LLM 网关(setup/gateway/)位于你的客户端
与服务引擎之间:

* 双方言翻译: 在进程内同时支持 Anthropic(/v1/messages)和 OpenAI
(/v1/chat/completions)。Claude Code、DeepSeek Harness、Cursor
以及脚本可以与正在运行的后端对话,而无需单独的桥接
守护进程。
* 真正的提示词与前缀缓存: 智能体提示词通常携带 20k–40k token
的系统指令和工具定义。在 llama.cpp 上,网关跟踪
前缀哈希并保存 KV 状态,将约 120 秒的冷预填充变为
1.3 秒的后续轮次(>90% 缓存复用)。在 Halogen 上,引擎
自行缓存,网关将 Claude Code 的缓存标记透传过去,使
其自动模式安全检查也能从转录结束处恢复:
每次检查 32.5 秒 → 18.6 秒,判定结果不变(24.09.2026,
报告)。
* 边缘稳定的流式传输: 针对工具调用的增量逐 token 参数流式传输
以及 10 秒 SSE 保活心跳,可防止 Cloudflare Tunnel
和代理在长时间生成时掉线(500 / 524)。
* 稳定的模型别名: 在你的客户端中使用 local-low、local 或 local-medium。
它们会解析为当前活动引擎的等效模式,因此切换
模型永远不会破坏你的客户端配置。
* 专用 CPU 视觉 Sidecar: 在主 GPU 模型之外
暴露 qwen3-vl-4b 和 vision。通过 llama-vision.service
在 8 个专用 Zen 5 CPU 核心(CCD1:核心 8–15)上运行,
并带有独立的准入闸门(VISION_GATE),
保护 Halogen GPU 解码免受内存总线争用影响。按需自动启动,
并在闲置 10 分钟后停止(VISION_IDLE_TIMEOUT=600),以回收 RAM 供 Linux
页缓存使用。完全兼容 Unity Asset Inventory、DeepSeek Harness
以及 OpenAI 多模态客户端。

内存权威:永不冻结机器

在 Strix Halo 这样的统一内存架构上,没有独立的 VRAM。
GPU 通过 GTT 分配主机 RAM,而该分配是固定的。
一个超出可用内存的工作负载不会被换出,也不会被 OOM 杀死:它会让整台机器硬冻结,使所有进程宕机,且不写入内核日志。

setup/lib/budget.py 会在启动前权衡每个配置文件,如果放不下就主动拒绝:

REFUSING TO START qwen38: it needs about 70.1 GiB and it does not fit.
the host has 44.2 GiB available, 12 must stay free

出于同样的原因,绝不要手动启动第二个模型——或媒体工作负载:python3 bench/sideserver.py 是唯一安全的方式,它会停止生产、计量内存上限,然后再把生产恢复。

不只是语言模型:多模态租户

自 2026 年 9 月 1 日起,同一台机器在同样的内存管理下渲染图像、语音和视频。在这台机器上测量,每项 n=3,空闲机器,每个输出均由机器判定:

| 工作负载 | 内容 | 成本 | 许可证 |
|---|---|---|---|
| flux-schnell | 文本到图像,1024² | 56 秒 / 图像 | Apache 2.0 |
| sdxl | 文本到图像,1024² | 112 秒 / 图像 | OpenRAIL++ |
| qwen-image | 文本到图像,最高质量档 | 409 秒 / 图像 | Apache 2.0 |
| qwen3-tts | 文本到语音,包含德语,Vulkan | 2.65× 实时 | Apache 2.0 |
| chatterbox | 文本到语音,声音克隆,23 种语言 | 0.29× 实时(CPU) | MIT |
| wan21-t2v | 文本到视频,480p | 约 9 分钟 / 2 秒片段 | Apache 2.0 |
| wan22-ti2v | 文本到视频,5B——更快且有标记 | 288 秒 / 片段,见其配置文件 | Apache 2.0 |

每个都在 setup/workloads/ 中声明其测量占用,并由 budget.py 守护。基础安装保持无 torch(约 20 秒的测试门禁证明了这一点);torch 工作负载被限制在 media/ 之后。

为什么不用通用运行器(比如 ollama)?

通用运行器能快速让端点跑起来,但它们是针对标准独立 GPU 或通用 CPU 回退构建的。在像 Strix Halo 这样的统一内存 APU 上,这会留下关键缺口:

| 能力 | 通用运行器(ollama 等) | 本技术栈 |
|---|---|---|
| 芯片目标 | 通用 CPU / CUDA | 为 Strix Halo gfx1151(128 GB UMA)量身定制并测量 |
| 引擎选择 | 单一内部运行时 | 每项任务使用最快引擎:Halogen(MTP)或打过补丁的 llama.cpp |
| 多方言网关 | 仅 OpenAI | 进程内 OpenAI ↔ Anthropic 转换(Claude Code 与 DSH) |
| 前缀与状态缓存 | 仅每次运行的内存内缓存 | 跨重启持久化,磁盘重载,即时后续轮次 |
| 流式稳定性 | 缓冲的工具负载 | 增量参数流式传输与 SSE 心跳,防止代理超时 |
| 内存安全 | 系统 OOM(硬冻结 Strix Halo) | 跨 LLM、Diffusion、TTS 与 Video 的严格 GTT 预算(budget.py) |

我们测量,而非声称

本仓库中没有任何内容基于估算或营销宣传:

* 每个标志都经过测量: 速度、上下文窗口和 KV 成本都带有
它们的日期和测量方法直接放在配置文件中的旁边
注释。
* 将缺陷作为可测试数据: 静默硬件损坏(例如 ////
退化)和上游 bug 作为数据记录在
setup/defects.json 中。python3 setup/lib/defects.py
会验证你正在运行的构建是否受影响。
* 严格的测试门禁: bash tests/run.sh 在约 20 秒内运行 1529 个测试,
无需 GPU,在任何内容进入生产环境之前验证解析器完整性、方言转换、
预算计算和防护栏。

从哪里开始

| 如果你想…… | 去这里 |
|---|---|
| 弄清这个仓库是否适合你的机器 | bash setup/preflight.sh — 先运行它 |
| 查看有哪些变更以及它是针对哪些组件版本测量的 | CHANGELOG.md |
| 从零开始设置机器 — 从 BIOS 到第一个 token | docs/setup/,共六章 |
| 运行它 — 服务、启动、四个上限 | setup/README.md |
| 将 Claude Code 或 OpenAI agent 指向它 — 你自己的或别人的 | docs/CONSUMERS.md,以及用 bash setup/consumer-info.sh 获取这些值 |
| 决定采用哪个模型,以及为什么当前模型用于生产 | docs/MODELS.md |
| 在同一台机器上生成图像、语音或视频 | setup/workloads/ — 这些配置文件包含所有测量数值 — 以及 setup/README.md 的工作负载注册表部分 |
| 验证正在运行的机器 — 门禁、实时通道、冒烟测试 | tests/README.md |
| 查看原始测量数据 | docs/measurements/ 和 bench/reports/ |
| 重复或扩展它们 | bench/ |
| 了解哪些内容受保护 | docs/SECURITY.md — 模型。SECURITY.md — 发现的问题应提交到哪里 |
| 修改某些内容而不破坏它 | tests/,以及 CONTRIBUTING.md |
| 报告它在你的机器上的表现 | 一个 issue — 这是这个仓库唯一无法自行测量的东西 |

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

同作者(loonylabs-dev)的其他插件

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群