Опиши место словами — и услышь его. ИИ теперь сводит звук сценой, а не кусочками

Смотри, идея на одну строку: ты описываешь место словами — «ночная электричка, полупустой вагон, стук колёс, кто-то шуршит пакетом» — и получаешь его звук. Не один эффект, а целую сцену: гул вагона фоном, шаги ближе, объявление станции где-то вдали. Включил в наушниках — и ты там.
Почему это стало возможно только сейчас
Звуки умели генерить и раньше — но кусочками. Один сервис давал голос. Другой — музыку. Третий — эффект дождя секунд на двадцать. А «звук места» — это не список эффектов, это баланс: комната гудит тихо, ложка звякает близко, поезд проходит далеко. Сводить кусочки в такую картину приходилось руками, как настоящему звукорежиссёру.
20 июля команда Seed из ByteDance представила Seed Audio 1.0 — модель, которая генерит речь, шумы, фон и музыку одним запросом, уже сведёнными в одну дорожку. С дыханием, акустикой комнаты, дальними и близкими планами. До двух минут за один проход — и можно попросить продолжение.
И главное для нас: модель уже доступна через обычный API на fal.ai — минута готового звука стоит около $0.19.
Почему именно это
Фоновые звуки — вещь, которой ты и так пользуешься: дождь для сна, кофейня для фокуса, костёр для чтения. Но до сих пор это были чужие пресеты — десять готовых лупов на сайте. А тут фон делаешь ты сам, любой, из головы: «библиотека старого замка», «палатка в грозу», «космическая станция, тихий гул систем».
И это личное. «Звук нашего похода» — с треском костра и той самой рекой — можно скинуть другу как открытку. А если дать модели фото как референс — она сделает звук места прямо со снимка из отпуска.
Чему научишься
- Дёргать генеративное API по-взрослому. Звук считается не мгновенно: отправил запрос — получил номер задачи — забрал результат. Это асинхронный паттерн, он встретится тебе везде, от картинок до видео.
- Писать промпт как сценарий. «Сделай дождь» даёт скучный шум. Сцена с планами — «близко / фоном / изредка» — даёт кино. Это отдельный навык, и он переносится на любую генерацию.
- Работать со звуком в браузере. Тег
<audio>, автоповтор, склейка дорожек — простые вещи, которые превращают mp3-файл в «бесконечный» фон. - Считать экономику. $0.19 за минуту — значит, вечер экспериментов стоит как чашка кофе. Полезно один раз посчитать до, а не удивляться после.
Готовый стартовый промпт
Не проси агента «сделай генератор звуков» — получишь заглушку с одним шумом. Скажи точно: какая модель, какой вход, что на странице:
Сделай сайт, который генерит звуки для сна.Сильный промпт зашивает три вещи, о которых новичок не догадается: ключ живёт на сервере, а не в странице; результат забирается через очередь; промпт модели — шаблон сцены с планами, а не свободный текст.
Как выглядит результат
Страничка с полем и тремя кнопками. Жмёшь «Костёр в лесу» — полминуты статуса «сводим сцену…» — и в плеере появляются две минуты звука: треск близко, ветер в кронах фоном, изредка ухает сова. Всё уже сведено — ты не склеивал ни одного файла. Кнопка скачивания — и «звуковая открытка» улетает другу в чат.
План на выходные
- Суббота, утро: заведи ключ на fal.ai и дёрни модель одним запросом из терминала. Услышь первую сцену — это лучший момент проекта.
- Суббота, день: промпт агенту → страница с полем, пресетами и плеером. Проверь на телефоне.
- Воскресенье: добавь автоповтор, кнопку «ещё 2 минуты» (продолжение сцены) и попробуй дать модели фото из отпуска как референс. Если хочется управлять не миром, а голосами — рядом есть озвучка с эмоциями в тегах: там речь, тут — всё вокруг неё.
Год назад «звук места» был профессией со студией и микшером. Теперь это поле ввода и один запрос — осталось придумать место.
Короткие уроки-истории, симулятор агента и ежедневная практика — в нашем мобильном приложении. Бесплатно.
Источник: ByteDance Seed — Seed Audio 1.0, fal.ai — модель и цены





