🧠 Многие думают, что нейросеть “рисует картинку с нуля”. На самом деле это не совсем так.
Большинство современных моделей (FLUX, Stable Diffusion, SDXL и многие другие) работают по принципу диффузии — они постепенно убирают шум, шаг за шагом восстанавливая нужное изображение. То же самое сегодня происходит и в генерации аудио: модель постепенно очищает шум или спектрограмму до готовой речи, музыки или звуков.
При этом далеко не всегда нужно начинать с чистого белого шума. Можно взять уже существующее изображение или аудио, немного “зашумить” его и попросить модель изменить только часть содержимого. Именно поэтому работают img2img, inpainting, ControlNet, а также многие инструменты редактирования фотографий и генерации речи.
На картинках я постарался собрать простую схему того, как устроены современные диффузионные модели, какие self-hosted инструменты сегодня наиболее популярны и из каких этапов состоит генерация.
Кстати, если интересна тема локальной генерации речи, недавно я отправил PR в китайский форк с Rust (Qwen3-TTS-Rust), который значительно упростил работу с библиотекой и добавил недостающие возможности. Благодаря этому использовать Qwen3 TTS в своих Rust-проектах стало заметно удобнее. Если занимаетесь локальным AI — рекомендую посмотреть.
💬 Если интересно, могу сделать такую же серию инфографик про:
- Transformer и Attention
- LLM “под капотом”
- KV Cache
- LoRA и QLoRA
- RAG
- MCP
- AI-агентов и современные workflow.
Также сейчас активно веду разработку новеллы, скоро будет в Стиме, а про недавно вышедший музыкальный альбом с реизданием расскажу на одном из стримов, запишем видосик, чтобы объяснить каким образом сейчас можно диффузионо улучшать ваши сырые артефакты
- Qwen3-TTS-Rust -> https://github.com/cgisky1980/Qwen3-TTS-Rust
- OpenVoice -> https://github.com/myshell-ai/openvoice
- LavaSR -> https://github.com/ysharma3501/LavaSR
- Voicebox -> https://github.com/jamiepine/voicebox
- Улучшатор сырых аудио
- AudioLDM2 (text-to-audio, #music generation) -> https://github.com/haoheliu/AudioLDM2
- Превратит гитару в скрипу
- Конвертер аудио в midi -> https://github.com/spotify/basic-pitch
- Тренировка моделей на своем голосе -> https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
- Исправлятор речи и пения по нотам -> https://github.com/SWivid/F5-TTS
- Звуковые эффекты