← 返回列表
未验证
AI 驱动的桌面数字音频工作站 — 分轨分离、卡拉 OK 与现场演出套件
尚未跑自动兼容性验证,可查看页面内的依赖与入口分析。 · 最近上游提交 2026/9/6 · 已提供中文文档
AI 驱动的桌面 DAW - 音轨分离、和弦检测、卡拉 OK
综合分
28.8
GitHub 分
28.8
用户评分
—
★ Stars
0
周下载量
—
安装插件(需先安装 dsh CLI 引擎:npm install -g @deepseek-ai/dsh)
dsh plugin --profile web add ewceniza9009/wilsonix-studio该插件未发布到 npm,走 GitHub 源安装(pnpm 若拦截 prepare 脚本,按其提示在 pnpm-workspace.yaml 的 allowBuilds 中放行后重跑)
数据截至 2026/9/18(元数据每日更新 · 实装验证按队列轮转,单条结论的验证时间见上方)
用户评分
还没有人投票,来当第一个
订阅周报,不错过优质插件更新
每周一封 · 高评分插件 + 新用户活动
README
WilSonix Studio PRO
AI 驱动的桌面数字音频工作站 — 分轨分离、卡拉 OK 与现场演出套件
Version
Platform
License
分离。对齐。母带。演出。
下载
Windows 安装程序 — 从 Releases 下载 v0.2.4
| 平台 | 状态 |
|----------|--------|
| Windows x64(NSIS 安装程序) | 稳定版(v0.2.4) |
| Android(Capacitor APK) | 测试版 |
| macOS / Linux | 从源码构建 |
v0.2.4 新功能
- 分轨定向和声:可直接从混音器通道条上,针对 LEAD_VOCALS 或 BACKGROUND_VOCALS 生成 3 声部全音阶和声。
- 动态分轨指示器:Vocal Studio HUD 显示当前激活的目标分轨与音乐调性。
- Go Gateway 代理修复:通过 7860 端口为所有和声、频谱修复和人声特征端点提供直接反向代理转发。
- 连续相位声码器自动调音:零音频切片、零分块边界、零边界咔嗒声、零梳状滤波。
- 高速 3 声部人声和声器:数秒内生成 +3 度全音阶、+5 度强力和声和 -8va 次人声分轨。
- 自适应浅色/深色模式:Vocal Studio 和 Spectral Repair 模态框会针对浅色和深色主题动态重新设计样式。
- 辅音与齿音去齿音保护:通过自动检测并绕过清辅音(s、sh、t、k、p、呼吸声)上的变调处理,防止出现嘶嘶/闪烁的相位杂音,使其保持 100% 纯净的原声。
- AI 歌手性别与二重唱检测:实时人声声学分类器可检测男声、女声以及二重唱/复音人声区间。
- 3 层颜色编码卡拉 OK 提词器:歌词会以 电光霓虹青(男声)、亮丽热粉(女声)和 金黄琥珀(二重唱 / 合唱)动态亮起,并在电视舞台提词器上显示当前歌手徽章([♂ SINGER 1]、[♀ SINGER 2]、[👥 DUET / BOTH])。
- 交互式歌手覆盖:提词器编辑器中每一行歌词上的可点击 [♂ HE] / [♀ SHE] / [👥 DUET] 标签,可即时手动重新分配并自动保存。
- 1080p MP4 视频制作,带烧录多风格字幕:高级 SubStation Alpha(.ass)渲染引擎通过 FFmpeg 将精确的歌手颜色直接烧录到导出的视频中。
- 连续音高表现评分:全面革新的评分引擎在整段人声录音上以 50ms 跳窗评估音高准确度和节奏,并具备音分级颤音容差(无硬编码分数)。
- AI 频谱修复与音轨“修复画笔”:交互式 2D STFT 频谱图查看器($20\text{ Hz} - 20\text{ kHz}$),支持点击拖拽框选,以及 3 种精准修复算法:衰减(-18dB)、环境填充(Wiener)和谐波插值。
- 次世代人声工作室与自然音阶三部和声器:生成离散的 +3 度自然音阶、+5 度强力和声和 -8 度低八度子人声音轨,锁定到检测到的歌曲调性和和弦,并将其作为可控推子直接添加到 DAW 混音器中。
- 共振峰锁定的人声特征变形:应用 Female Bright、Male Warmth 或 Vintage Radio 配置文件,而不会产生花栗鼠式失真。
- 原生 Rust DSP 核心(crates/wilsonix-dsp):SIMD RealFFT 修复引擎和 GCC-PHAT 瞬态相位对齐,实现零延迟的 C 级速度音频计算。
功能
音轨分离
上传任意音频或视频文件,让 AI 将其分离为独立音轨:
| 引擎 | 音轨 | 速度 | 最适合 |
|--------|-------|-------|----------|
| Demucs v4 | 6(人声、鼓、贝斯、吉他、钢琴、其他) | 约 2.5 分钟 | 完整工作室分解 |
| Demucs v4 | 4(人声、鼓、贝斯、其他) | 约 1.5 分钟 | 经典多轨 |
| UVR MDX-Net ONNX | 2(人声 + 伴奏) | 约 50 秒 | 快速卡拉 OK / 伴奏 |
| BS-RoFormer | 2(人声 + 伴奏) | SOTA(12.98 dB SDR) | 录音室母带级质量 |
- 全程 32 位浮点处理
- 多吉他空间分解(4 路方位角)
- Solo Protect — 从人声音轨中恢复主奏乐器
- 质量模式:Draft / Studio HQ / Ultra HD / Mastering Grade
DAW 混音器
功能齐全的多通道混音器,支持每音轨控制:
- 音量推子(0–150%)+ 声像旋钮(立体声声像器)
- 每通道 静音 / 独奏
- 3 段参数均衡器 — 低架(250 Hz)、中频峰值(1.2 kHz)、高架(4.5 kHz)
- 低切滤波器 — 80 Hz 隆隆声消除
- 压缩器 — 阈值 -18 dB,压缩比 3:1
- 磁带饱和器 — 模拟电子管温暖感,4 倍过采样
- 立体声合唱 — LFO 调制延迟
- Haas 效果扩展器 — 立体声空间扩展
- 混响发送 — 卷积大厅总线(2.2 秒)
- 延迟发送 — 350ms 速度同步反馈延迟
- 每通道 FFT 分析器 + OLED 波形显示
- 每通道 6 个内置 FX 预设
- 导入自定义 WAV 文件作为混音器通道
和弦检测
- 由 AI 驱动的实时和弦识别
- 乐器选择器:Guitar / Bass / Piano / All(Mix)
- Harmonics 条带中可滚动的和弦进行时间线
- 和弦缓存到数据库中,可即时重新加载
卡拉 OK 舞台
- Whisper AI 词级转录(毫秒级精度)
- 多语言:英语、比萨亚语、他加禄语、日语、韩语、中文、西班牙语、法语、德语
- OLED 提词器,带物理弹跳球 + 逐词发光高亮
- 6 种迷幻视觉主题(Cyber Aurora、Warp Tunnel、Plasma Orbs、Synthwave Grid、Matrix Starfield、Kaleidoscope Nebula)
- 歌词编辑器,支持撤销/重做、间隙自动填充、幻觉检测面板
- 导出: .LRC 和 .ASS 字幕文件
- 同步偏移微调(-0.1s / +0.1s)
- 实时麦克风跟唱,带实时音高跟踪
- 音高雷达画布可视化
自动调音与人声处理
- 神经自动调音(WORLD Vocoder)——保留共振峰的音高修正
- 音阶:Chromatic、Auto、Major 调
- 预设:T-Pain、Pop、Natural
- AI 麦克风增强——降噪 + 去齿音 + 胶囊激励器
- 配置文件:Neumann U87、Shure
双屏电视舞台
- 弹出专用全屏提词器到任意外部电视或显示器
- 零延迟歌词提词器,带和弦同步
- 非常适合现场卡拉 OK 表演
卡拉 OK 视频制作
- 1080p MP4 导出,带烧录的动画发光歌词
- 高亮颜色:霓虹青、暖琥珀、活力粉、翡翠薄荷
- 人声导唱音量滑块
- 标题 / 艺术家元数据
- 表演视频重封装(浏览器录制 → 广播 H.264/AAC)
自动母带处理
- 一键 AI 母带处理至 -14 LUFS(流媒体标准)
- ITU-R BS.1770 / EBU R128 K 加权滤波器
- 多频段 DSP 处理
- 真峰值限制器
- 24 位母带 WAV 输出
文件检查器
- MIDI 文件解析器——音符、速度映射、钢琴卷帘可视化
- ASS 字幕检查器——样式、事件、卡拉 OK 时间轴
- 快速 ASS 覆盖标签解析器
后端日志
- 实时日志流,带颜色编码输出
- 按级别筛选:全部 / 错误 / 警告 / 信息
- 自动滚动,带清除按钮
库与项目历史
- 搜索和筛选过往项目
- 状态跟踪(已完成 / 失败 / 处理中)
- 一键“在 Studio 中打开”以重新加载分轨
- 将分轨下载为 ZIP
- 对活动任务自动刷新轮询
管理员控制中心
- CPU、RAM、GPU、磁盘遥测
- 用户管理(角色:管理员 / 制作人)
- 任务队列监控
- 清除过期数据的分轨
技术栈
| 层级 | 技术 | 用途 |
|-------|-----------|---------|
| 桌面外壳 | Tauri v2(Rust) | 原生窗口、系统集成、进程管理 |
| 后端服务器 | Go | HTTP 服务器、WebSocket 中继、SQLite 数据库、认证、路由 |
| AI 引擎 | Python 3.12 + PyTorch | 分轨分离、和弦检测、歌词转录 |
| ML 模型 | Demucs v4、UVR MDX-Net、BS-RoFormer、OpenAI Whisper | AI 音频处理 |
| 前端 | Vanilla JS + Tailwind CSS + Anime.js + Lucide Icons | 响应式 DAW 工作区 |
| 音频 DSP | Web Audio API(32 位浮点) | 实时混音、EQ、压缩、效果 |
| 数据库 | SQLite(通过 Go) | 用户、任务、音轨、歌词、和弦 |
| 移动端 | Capacitor + ONNX Runtime Mobile | 带离线推理的 Android APK |
| 安装程序 | NSIS | Windows 安装程序打包 |
| 构建 | PyInstaller | Python → 单个 .exe 打包 |
系统要求
| 组件 | 最低配置 | 推荐配置 |
|-----------|---------|-------------|
| 操作系统 | Windows 10 x64 | Windows 11 |
| 内存 | 4 GB | 8 GB+ |
| 存储 | 2 GB 可用空间 | 5 GB+(用于模型) |
| CPU | 双核 2 GHz | 四核+ 支持 AVX |
| GPU | 无(CPU 可运行) | 支持 CUDA 的 NVIDIA GPU,可加快推理速度 |
支持的格式
| 输入 | 格式 |
|-------|---------|
| 音频 | WAV, FLAC, MP3, M4A, OGG, OPUS |
| 视频 | MP4, MKV, MOV, WebM, AVI |
| 字幕 | .ASS, .SSA |
| MIDI | .mid, .midi |
键盘快捷键
| 按键 | 操作 |
|-----|--------|
| Space | 播放 / 暂停 |
| M | 静音所选声道 |
| S | 独奏所选声道 |
| 0 | 倒回开头 |
| [ / ] | 设置循环点 A / B |
| L | 切换循环 |
| Ctrl+Z | 撤销 |
| Ctrl+Shift+Z | 重做 |
| Esc | 关闭模态窗口 |
移动端(Android)
WilSonix Studio PRO 通过 Capacitor 以 Android APK 形式提供:
- 可滑动的 6 音轨混音器轮播
- 手势锁定的音频滑块
- 使用 ONNX Runtime Mobile 的离线 AI 推理
- 针对触摸优化、支持安全区域的 UI
从源代码构建
先决条件
- Go 1.22+
- Rust + Tauri CLI
- Python 3.12 及 venv
- NSIS(用于 Windows 安装程序)
构建步骤
Clone
git clone https://github.com/ewceniza9009/pygo.git
cd pygo
Python environment
python -m venv python_env
python_env\Scripts\activate
pip install -r requirements.txt
Build Python worker (PyInstaller)
pyinstaller --onefile --name python_worker --noconfirm \
--distpath src-tauri\resources \
--collect-data audio_separator \
--collect-submodules audio_separator \
--collect-all onnxruntime \
run_worker.py
Build Go server
go build -ldflags "-s -w" -o src-tauri\resources\pygo_server.exe .
Build Tauri desktop app
cd src-tauri
cargo tauri build
架构
┌─────────────────────────────────────────────┐
│ Tauri (Rust) Shell │
│ ┌──────────┐ ┌──────────────────────────┐ │
│ │ Webview │ │ Process Manager │ │
│ │ (HTML) │ │ ├─ pygo_server.exe │ │
│ │ │ │ └─ python_worker.exe │ │
│ └──────────┘ └──────────────────────────┘ │
└─────────────────────────────────────────────┘
│ HTTP/WebSocket │ HTTP
┌────▼────┐ ┌────▼────┐
│ Go │────────────│ Python │
│ Server │ proxy WS │ FastAPI │
│ :7860 │ │ :19876 │
└────┬────┘ └────┬────┘
│ │
┌────▼────┐ ┌────▼────────────┐
│ SQLite │ │ PyTorch / ONNX │
│ (DB) │ │ Demucs/Roformer │
└─────────┘ │ Whisper │
└─────────────────┘
开发者
Erwin Wilson E. Ceniza
许可证
专有。保留所有权利。扫码进群