🎁 福利专区全网大模型免费应用 + 新用户福利 + 注册活动入口,低成本玩转 AI
广告☁️ 云服务器特惠阿里云首购 8 折 · 腾讯云合作特惠
DeepSeek Harness Hub
← 返回列表

Alyosha28/dsh-plugin-c2c

DeepSeek Harnessspec-screened扫描:中风险在 GitHub 查看 ↗
⚠ 装前注意

面向 DeepSeek Harness 的 Cache-to-Cache。

基本兼容但装前注意:未发布到 npm registry,仅可从源码安装 · 最近上游提交 2026/9/19 · 已提供中文文档

DeepSeek Harness 的缓存到缓存(C2C):两个本地 LLM 共享 KV 缓存,而不是交换文本,并以 c2c_* 智能体工具的形式暴露

综合分
29.6
GitHub 分
29.6
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add Alyosha28/dsh-plugin-c2c
未发布到 npm registry,仅可从源码安装,改用 GitHub 源安装
信任档位:仅索引本站尚未对其实装验证,仅收录元数据
是什么
dsh 原生插件 · chat
装得上吗
静态安装检查有提示项,装前建议看一眼 README
安全吗
本站尚未对该插件做风险分级(暂未覆盖,不等同于无风险)
还在维护吗
活跃:最近一次提交在 7 天前

档位由下列信号合成:本站实装验证(真实安装,当前最高到 L4)· 验证所用 dsh 版本 · 静态安装检查 · 风险分级 · 仓库维护状态。下方各区块是它的证据明细。 验证判据与等级说明 →

数据截至 2026/9/22(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
安装兼容性检查⚠ 装前注意

以下结论由程序自动检查 npm 包、engines 声明与入口文件得出,未做人工实机验证——能装不等于用着没问题。

✗npm 包dsh-plugin-c2c(未发布到 npm,仅可源码安装)
✓Node 引擎要求 >=20 · 基线 Node 22.19 满足
✓dsh CLI 依赖未声明 dsh 版本约束
✓入口文件main/exports/bin 已声明

未发布到 npm registry,仅可从源码安装

验证方式:npm registry 存在性 + package.json 静态校验 · 最后验证 2026/9/22 15:34:39

用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

由 DeepSeek 最新模型翻译生成
dsh-plugin-c2c

面向 DeepSeek Harness 的 Cache-to-Cache。
两个本地 LLM 共享 KV 缓存,而不是交换文本。

这是什么

一个 DSH 插件,将 thu-nics/C2C
(Cache-to-Cache: Direct Semantic Communication Between Large Language Models,
ICLR'26)暴露为六个 c2c_ 智能体工具。

C2C 同时运行两个模型——一个负责回答的接收方,以及一个或多个
共享方——并将共享方的 KV 缓存投影到接收方的缓存空间中,
在接收方生成任何内容之前将其融合。共享方直接贡献其
内部状态。两者之间不传递任何文本。

为什么 / 背后的理念

如今当一个模型把工作交给另一个模型时,交接的是文本:模型 A 写出一段
补全,模型 B 将其作为 token 读取。这条通道在构造上就是有损的——
凡是 token 无法拼写出来的东西,接收方永远无从得知。

C2C 论文的观察是,KV 缓存就是模型的工作状态,因此
交接完全不必经过语言。将缓存投影到
接收方的空间,融合,接收方就从更丰富的位置开始。论文
报告称,相比任一单独模型,准确率提升 8.5–10.5%,相比
基于文本的通信提升 3.0–5.0%。

本插件并未发明其中任何内容;它只是打包了上游运行时,使 DSH
会话能够驱动它。关于此处已验证和未验证的内容,请参见准确率声明。

安装

1. set up the C2C runtime (clones upstream, builds a venv, pins transformers)
python python/dsh_c2c_setup.py --root ~/factor_digging/c2c --verify

2. install the plugin
dsh plugin --profile web add Alyosha28/dsh-plugin-c2c

安装步骤只需一条命令,且不会下载权重。约 3.2 GB 的模型
文件会在首次 c2c_load 时到达,缓存在 /models/hf 下。

然后重启会话——使用 patchReload: startup 的配置文件会在启动时加载插件。

使用

c2c_load    pair: qwen3_0.6b+qwen2.5_0.5b     # build the fused model
c2c_chat    prompt: "..."                      # answer through the fusion
c2c_compare prompt: "..."                      # fused vs receiver-alone, side by side
c2c_unload                                     # release device memory

c2c_compare 是有意思的那个:它把同一个提示词运行两次,一次
融合了共享方,一次只用接收方,并展示两个答案。两种
条件唯一的区别在于是否应用了投影,因此你看到的差异
可归因于融合。

总共六个工具:c2c_status、c2c_models、c2c_load、c2c_chat、c2c_compare、
c2c_unload。

上游附带七对融合器,从 0.6B+0.5B 到 8B+7B。最小的那对
在笔记本电脑上运行毫无压力。

它真正有用的地方

- 以组合知识作答。 两个融合的小模型可以解决
任一单独模型都无法处理的提示词。在测试中,一个接收方在推导中途卡住,而一个
多步算术提示在分享者的缓存被融合进来后,产生了不同且更完整的思维链。
- 比解码器级集成更快。 分享者和投影器在提示传递期间只运行一次,而不是每个 token 运行一次,因此融合解码的成本与仅接收者解码相同。实测:在相同提示下,融合为 64 tok/s,而仅接收者为 39 tok/s。
- 本地且封闭。 权重、投影和生成都留在本机上。守护进程仅绑定回环地址,除首次使用时下载 Hugging Face 外不进行任何出站调用。
- 权重保持热状态。 守护进程的生命周期长于插件领域,因此配置文件补丁重载不会丢弃已加载的模型对,重复提问可跳过加载成本(此处约 7 秒)。空闲模型对在 idleUnloadSeconds 后被释放。
- 可在 Apple Silicon 上运行。 上游面向 Linux+CUDA。此版本已移植到 MPS 后端并经过验证;见下文。

已验证的数据

arm64 Mac,48 GB 统一内存,macOS 26,torch 2.14.0,transformers 4.52.4,
MPS 上使用 float16,最小模型对(Qwen3-0.6B 接收者 + Qwen2.5-0.5B-Instruct 分享者):

| | |
|:--|:--|
| 加载,磁盘上的权重 | 6.9–7.7 秒(2 个模型 + 28 个投影器) |
| 解码,仅接收者 | 39 tok/s |
| 解码,C2C 融合 | 64 tok/s |
| 预填充 + 96 个 token,融合 | 1.5 秒 |
| 权重 | 约 3.2 GB |

架构

DSH agent ── c2c_ tools ──HTTP/loopback──► c2c_daemon.py ──► rosetta (PyTorch)
(Node)        (this plugin)                  (Python)        receiver + sharer
+ C2C projectors

- Node 插件从不导入 Python 或 torch。 它按需启动守护进程并转发 HTTP 调用,因此插件加载保持快速,且损坏的 Python 环境不会破坏 DSH 启动。
- 守护进程拥有权重。 冷加载需要数秒,且底层模型不适合并发生成,因此工作在一个锁后串行化,而不是每次调用都支付加载成本。

要求

- Python 3.10–3.13(PyTorch wheel 可用性)。
- macOS(MPS)、Linux(CUDA)或 CPU。8B+7B 模型对需要约 32 GB+ 的设备内存。
- transformers 被安装脚本固定为 4.52.4——这是上限,不是下限。 rosetta 通过向 DynamicCache.key_cache 追加来克隆 KV 缓存,而该属性仅在 4.54.x 及之前是普通列表;transformers 4.55 对其进行了包装,没有 .append(),4.56 移除了该属性。两者都会破坏整个融合路径,且故障仅在模型加载时出现。安装当前的 transformers 看起来没问题,直到它出问题为止。
- 需要 accelerate:每个上游加载器都传递 device_map=,没有它 transformers 会拒绝。上游仅将其列在可选额外项下。

配置

默认值无需编辑即可工作——repoRoot 和 pythonPath 会自动检测。
在配置文件的 cordis.patch.yml 中覆盖:

- id: c2c
config:
repoRoot: /path/to/c2c           # 默认值:自动检测
pythonPath: /path/to/python      # 默认值:/.venv/bin/python
port: 8765                       # 回环守护进程端口
idleUnloadSeconds: 900           # 0 表示禁用空闲释放
loadTimeoutSeconds: 600

依赖模型

@deepseek-ai/* 包被声明为 peerDependencies,与其他已发布的 DSH 插件一致,
并且该插件不附带 node_modules。在运行时,它们通过安装的共享闭包在
$DSH_HOME/profiles/node_modules 处解析。

符号链接的开发检出是一个例外:dsh plugin add  会安装一个符号链接,
而 Node 会将其解析为其真实路径,因此模块查找会从你的检出目录开始,永远不会到达
共享闭包。捆绑的 .npmrc 设置了 auto-install-peers=true,因此在检出目录中执行
普通的 pnpm install 即可将它们实体化。

手动运行守护进程

该守护进程是一个独立的 HTTP 服务,无需 DSH 即可使用:
bash
python python/c2c_daemon.py --repo-root /path/to/c2c --port 8765
curl -s localhost:8765/models
curl -s -X POST localhost:8765/generate \
-H 'content-type: application/json' \
-d '{"prompt":"Say hello.","mode":"c2c","max_new_tokens":48}'

MPS 注意事项

- 不要在 MPS 上启用采样解码。 已知 torch.multinomial 在那里会返回
零概率索引
(pytorch#192577),这会
静默地破坏采样输出。贪婪解码不受影响,并且是默认方式。工具描述中记录了这一点。
- dtype 在 MPS 上解析为 float16,在 CUDA 上解析为 bfloat16,在 CPU 上解析为
float32。已发布的投影器以 bfloat16 存储;它们在构造时会被重新转换为接收方的
dtype。
- PYTORCH_ENABLE_MPS_FALLBACK=1 会被自动设置,因此没有 MPS 内核的算子会回退到
CPU,而不是在生成过程中抛出异常。

准确性声明

论文报告称,相较于单个模型有 8.5–10.5% 的准确率提升。本插件尚未测量这一点。
这里所验证的是流水线能够端到端运行,并且融合会改变输出——这是一次冒烟测试,而非
基准测试。将单个 c2c_compare 结果视为论文数据的证据是错误的;那需要针对每种条件
评估一个基准测试子集。

局限性

- 只有最小的模型对经过了端到端验证。1.7B 和 8B 的注册表条目使用相同的代码路径,
但尚未在此处运行过。
- 每次加载一个共享者。上游支持多共享者融合(kv_cache_index 中的位掩码);
本插件尚未公开该功能。
- 没有自动化测试套件。python/verify_c2c.py 是一次手动端到端检查。
- 训练、多 GPU 以及由 SGLang 支持的评估框架不在范围内——它们仅支持 CUDA,
且未被复现。

致谢

融合方法以及 rosetta 运行时来自
thu-nics/C2C,作者为 Tianyu Fu、Zihan Min、Hanling
张、Jichao Yan、Guohao Dai、Wanli Ouyang 和 Yu Wang。如果你使用了该方法,
请引用他们的论文:
bibtex
@article{fu2025c2c,
title={Cache-to-Cache: Direct Semantic Communication Between Large Language Models},
author={Tianyu Fu and Zihan Min and Hanling Zhang and Jichao Yan and Guohao Dai and Wanli Ouyang and Yu Wang},
journal={arXiv preprint arXiv:2510.03215},
year={2025},
}

本仓库为 DSH 打包了该运行时。它不包含任何模型权重,也未
内置他们的任何代码。

许可证

MIT。上游 C2C 同样采用 MIT。

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

同作者(Alyosha28)的其他插件

💬 加入社群

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

DPharness QQ 群二维码,QQ 扫码进群
QQ 扫码进群
DPharness 飞书群二维码,飞书扫码进群
飞书扫码进群