Перейти к основному содержимому

Songsee

Аудиоспектрограммы/признаки (mel, chroma, MFCC) через CLI.

Метаданные навыка​

ИсточникВстроенный (устанавливается по умолчанию)
Путьskills/media/songsee
Версия1.0.0
Авторcommunity
ЛицензияMIT
Платформыlinux, macos, windows
ТегиAudio, Visualization, Spectrogram, Music, Analysis

Справочник: полный SKILL.md​

к сведению

Ниже приведено полное описание навыка, которое VibeOS загружает при его активации. Это те инструкции, которые видит агент, когда навык активен.

songsee

Генерация спектрограмм и многопанельных визуализаций аудио-признаков из аудиофайлов.

Предварительные требования​

Требуется Go:

go install github.com/steipete/songsee/cmd/songsee@latest

Опционально: ffmpeg для форматов, отличных от WAV/MP3.

Быстрый старт​

# Базовая спектрограмма
songsee track.mp3

# Сохранение в конкретный файл
songsee track.mp3 -o spectrogram.png

# Сетка многопанельной визуализации
songsee track.mp3 --viz spectrogram,mel,chroma,hpss,selfsim,loudness,tempogram,mfcc,flux

# Временной срез (начало в 12.5 с, длительность 8 с)
songsee track.mp3 --start 12.5 --duration 8 -o slice.jpg

# Из stdin
cat track.mp3 | songsee - --format png -o out.png

Типы визуализации​

Используйте --viz со значениями, разделёнными запятыми:

ТипОписание
spectrogramСтандартная частотная спектрограмма
melМел-спектрограмма
chromaРаспределение по классам высоты тона
hpssГармоническое/перкуссионное разделение
selfsimМатрица самоподобия
loudnessГромкость во времени
tempogramОценка темпа
mfccМел-частотные кепстральные коэффициенты
fluxСпектральный поток (обнаружение атак)

Несколько типов --viz отображаются в виде сетки в одном изображении.

Общие флаги​

ФлагОписание
--vizТипы визуализации (через запятую)
--styleЦветовая палитра: classic, magma, inferno, viridis, gray
--width / --heightРазмеры выходного изображения
--window / --hopРазмер окна БПФ и шаг
--min-freq / --max-freqФильтр диапазона частот
--start / --durationВременной срез аудио
--formatВыходной формат: jpg или png
-oПуть к выходному файлу

Примечания​

  • WAV и MP3 декодируются нативно; для других форматов требуется ffmpeg
  • Выходные изображения можно анализировать с помощью vision_analyze для автоматического анализа аудио
  • Полезно для сравнения аудиовыходов, отладки синтеза или документирования конвейеров обработки аудио