← 返回列表
未验证
量化大模型长文本各位置召回率并绘制 U 型曲线
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/8/22 · 已提供中文文档
A CLI tool to test and visualize the "Lost-in-the-Middle" phenomenon in Large Language Models. 一个用于测试和可视化大语言模型"Lost-in-the-Middle"现象的命令行工具。
综合分
28.2
GitHub 分
28.2
用户评分
—
★ Stars
1
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add PerryLink/Lost-in-Middle-Tester该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/16(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
Lost-in-Middle-Tester 用于测试和可视化大语言模型 "Lost-in-the-Middle"(中间丢失)现象的命令行工具。 已移植到 dsh-library —— PerryLink DSH 插件家族的一员。 License English · 简体中文 功能简介 大语言模型在处理长文本时,对开头和结尾信息的记忆通常优于中间位置的信息——这是论文 Lost in the Middle: How Language Models Use Long Contexts 中描述的一个已知局限。Lost-in-Middle-Tester 用于量化这一现象:它生成一篇长文档,在指定位置插入一个 SECRET_CODE_XXXX 形式的验证码,让模型找出该验证码,并统计每个位置的成功率。 功能特性 - 生成内嵌验证码的长文本测试用例 - 支持 OpenAI 与 Anthropic 两种 API 提供商 - 输出 U 型曲线图(PNG)与各位置成功率的 JSON 报告 - 提供每个位置的详细统计与成功/失败总数 - 提供成本估算与 --dry-run 预览模式 - 使用 Rich 渲染终端进度条与结果表格 快速开始 需要 Python 3.9+ 与 Poetry。 git clone https://github.com/PerryLink/Lost-in-Middle-Tester.git cd Lost-in-Middle-Tester poetry install 设置 API 密钥后即可运行测试: OpenAI export OPENAI_API_KEY=sk-xxx poetry run lost-in-middle-tester test --model gpt-4 Anthropic export ANTHROPIC_API_KEY=sk-ant-xxx poetry run lost-in-middle-tester test --provider anthropic --model claude-3-opus-20240229 使用方法 自定义测试参数 poetry run lost-in-middle-tester test \ --model gpt-4 \ --text-length 10000 \ --num-tests 30 \ --num-positions 15 \ --output-dir ./my-results 预览配置与预估成本(不调用 API) poetry run lost-in-middle-tester test --model gpt-4 --dry-run | 参数 | 默认值 | 说明 | |------|--------|------| | --api-key | 环境变量 | API 密钥(回退到 OPENAI_API_KEY / ANTHROPIC_API_KEY) | | --model | gpt-4 | 模型名称 | | --provider | openai | API 提供商(openai / anthropic) | | --text-length | 8000 | 文档长度(tokens) | | --num-tests | 20 | 每个位置的测试次数 | | --num-positions | 10 | 测试位置数量 | | --output-dir | ./results | 输出目录 | | --show-plot | True | 是否渲染图表 | | --dry-run | False | 预览配置与成本估算 | 工作原理 1. 文本生成 —— 生成约 --text-length 个 token 的长文本,混合 Lorem Ipsum 与知识段落 2. 验证码插入 —— 在选定位置(0.0–1.0)插入随机 SECRET_CODE_XXXX 验证码 3. 模型测试 —— 要求模型在文档中找出该验证码 4. 结果统计 —— 记录每个位置的成功率 5. 可视化 —— 渲染 U 型曲线图并写入 JSON 报告 基于 Typer + Rich、OpenAI 与 Anthropic SDK 以及 Matplotlib 构建。测试使用 pytest,Black 与 Ruff 用于代码格式化。 开发 poetry run pytest -v poetry run black src/ poetry run ruff check src/ 相关项目 - dsh-library —— 本工具已移植进的 DSH 插件 - PerryLink —— PerryLink DSH 插件家族 许可证 Apache License 2.0 © 2026 PerryLink
扫码进群