Songsee
Аудиоспектрограммы/признаки (mel, chroma, MFCC) через CLI.
Метаданные навыка
| Источник | Встроенный (устанавливается по умолчанию) |
| Путь | skills/media/songsee |
| Версия | 1.0.0 |
| Автор | community |
| Лицензия | MIT |
| Платформы | linux, macos, windows |
| Теги | Audio, Visualization, Spectrogram, Music, Analysis |
Справочник: полный SKILL.md
к сведению
Ниже приведено полное описание навыка, которое VibeOS загружает при его активации. Это те инструкции, которые видит агент, когда навык активен.
songsee
Генерация спектрограмм и многопанельных визуализаций аудио-признаков из аудиофайлов.
Предварительные требования
Требуется Go:
go install github.com/steipete/songsee/cmd/songsee@latest
Опционально: ffmpeg для форматов, отличных от WAV/MP3.
Быстрый старт
# Базовая спектрограмма
songsee track.mp3
# Сохранение в конкретный файл
songsee track.mp3 -o spectrogram.png
# Сетка многопанельной визуализации
songsee track.mp3 --viz spectrogram,mel,chroma,hpss,selfsim,loudness,tempogram,mfcc,flux
# Временной срез (начало в 12.5 с, длительность 8 с)
songsee track.mp3 --start 12.5 --duration 8 -o slice.jpg
# Из stdin
cat track.mp3 | songsee - --format png -o out.png
Типы визуализации
Используйте --viz со значениями, разделёнными запятыми:
| Тип | Описание |
|---|---|
spectrogram | Стандартная частотная спектрограмма |
mel | Мел-спектрограмма |
chroma | Распределение по классам высоты тона |
hpss | Гармоническое/перкуссионное разделение |
selfsim | Матрица самоподобия |
loudness | Громкость во времени |
tempogram | Оценка темпа |
mfcc | Мел-частотные кепстральные коэффициенты |
flux | Спектральный поток (обнаружение атак) |
Несколько типов --viz отображаются в виде сетки в одном изображении.
Общие флаги
| Флаг | Описание |
|---|---|
--viz | Типы визуализации (через запятую) |
--style | Цветовая палитра: classic, magma, inferno, viridis, gray |
--width / --height | Размеры выходного изображения |
--window / --hop | Размер окна БПФ и шаг |
--min-freq / --max-freq | Фильтр диапазона частот |
--start / --duration | Временной срез аудио |
--format | Выходной формат: jpg или png |
-o | Путь к выходному файлу |
Примечания
- WAV и MP3 декодируются нативно; для других форматов требуется
ffmpeg - Выходные изображения можно анализировать с помощью
vision_analyzeдля автоматического анализа аудио - Полезно для сравнения аудиовыходов, отладки синтеза или документирования конвейеров обработки аудио