DeepSeek Harness Hub
← 返回列表

长文本中间丢失测试PerryLink/Lost-in-Middle-Tester

DeepSeek Harnessspec-screened在 GitHub 查看 ↗
未验证

量化大模型长文本各位置召回率并绘制 U 型曲线

尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/22 · 已提供中文文档

A CLI tool to test and visualize the "Lost-in-the-Middle" phenomenon in Large Language Models. 一个用于测试和可视化大语言模型"Lost-in-the-Middle"现象的命令行工具。

综合分
28.2
GitHub 分
28.2
用户评分
★ Stars
1
周下载量
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add PerryLink/Lost-in-Middle-Tester
该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动

README

Lost-in-Middle-Tester

用于测试和可视化大语言模型 "Lost-in-the-Middle"(中间丢失)现象的命令行工具。

已移植到 dsh-library —— PerryLink DSH 插件家族的一员。

License

English · 简体中文

功能简介

大语言模型在处理长文本时,对开头和结尾信息的记忆通常优于中间位置的信息——这是论文 Lost in the Middle: How Language Models Use Long Contexts 中描述的一个已知局限。Lost-in-Middle-Tester 用于量化这一现象:它生成一篇长文档,在指定位置插入一个 SECRET_CODE_XXXX 形式的验证码,让模型找出该验证码,并统计每个位置的成功率。

功能特性

- 生成内嵌验证码的长文本测试用例
- 支持 OpenAI 与 Anthropic 两种 API 提供商
- 输出 U 型曲线图(PNG)与各位置成功率的 JSON 报告
- 提供每个位置的详细统计与成功/失败总数
- 提供成本估算与 --dry-run 预览模式
- 使用 Rich 渲染终端进度条与结果表格

快速开始

需要 Python 3.9+ 与 Poetry。

git clone https://github.com/PerryLink/Lost-in-Middle-Tester.git
cd Lost-in-Middle-Tester
poetry install

设置 API 密钥后即可运行测试:

OpenAI
export OPENAI_API_KEY=sk-xxx
poetry run lost-in-middle-tester test --model gpt-4

Anthropic
export ANTHROPIC_API_KEY=sk-ant-xxx
poetry run lost-in-middle-tester test --provider anthropic --model claude-3-opus-20240229

使用方法

自定义测试参数
poetry run lost-in-middle-tester test \
--model gpt-4 \
--text-length 10000 \
--num-tests 30 \
--num-positions 15 \
--output-dir ./my-results

预览配置与预估成本(不调用 API)
poetry run lost-in-middle-tester test --model gpt-4 --dry-run

| 参数 | 默认值 | 说明 |
|------|--------|------|
| --api-key | 环境变量 | API 密钥(回退到 OPENAI_API_KEY / ANTHROPIC_API_KEY) |
| --model | gpt-4 | 模型名称 |
| --provider | openai | API 提供商(openai / anthropic) |
| --text-length | 8000 | 文档长度(tokens) |
| --num-tests | 20 | 每个位置的测试次数 |
| --num-positions | 10 | 测试位置数量 |
| --output-dir | ./results | 输出目录 |
| --show-plot | True | 是否渲染图表 |
| --dry-run | False | 预览配置与成本估算 |

工作原理

1. 文本生成 —— 生成约 --text-length 个 token 的长文本,混合 Lorem Ipsum 与知识段落
2. 验证码插入 —— 在选定位置(0.0–1.0)插入随机 SECRET_CODE_XXXX 验证码
3. 模型测试 —— 要求模型在文档中找出该验证码
4. 结果统计 —— 记录每个位置的成功率
5. 可视化 —— 渲染 U 型曲线图并写入 JSON 报告

基于 Typer + Rich、OpenAI 与 Anthropic SDK 以及 Matplotlib 构建。测试使用 pytest,Black 与 Ruff 用于代码格式化。

开发

poetry run pytest -v
poetry run black src/
poetry run ruff check src/

相关项目

- dsh-library —— 本工具已移植进的 DSH 插件
- PerryLink —— PerryLink DSH 插件家族

许可证

Apache License 2.0 © 2026 PerryLink

上游仓库有新提交时邮件通知你(每天最多一封,无更新不打扰),随时一键退订。

💬 加入 DPharness 群聊

插件用法、部署报错、新插件第一时间同步——群里问,比一个人翻文档快。

点击加入 QQ 群
DPharness 群聊二维码,手机 QQ 扫码进群
扫码进群