Google представил две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Эти модели призваны трансформировать генерацию голоса из статических пресетов в динамическую творческую студию. Разработчики и компании теперь могут создавать более выразительные аудиоматериалы, улучшая пользовательский опыт в таких продуктах, как Gemini Notebook и Google Vids.
Что произошло
Gemini 3.8 Flash TTS ориентирована на глубокое творческое управление и дизайн персонажей. Она позволяет создавать совершенно новые голоса с нуля, используя подсказки на естественном языке, что идеально подходит для игр, иммерсивных аудиокниг, подкастов и интерактивных медиа. Модель предоставляет детальный контроль над актерскими репликами, темпом, изменениями диалекта и обратной связью, позволяя режиссировать каждое исполнение построчно. Gemini 3.8 Flash-Lite TTS, в свою очередь, оптимизирована для высокообъемного и экономичного масштабирования, подходящего для дубляжа, создания аудиоконтента и экспрессивных голосовых агентов с точным контролем над тоном, темпом и выразительными нюансами. Google подчеркивает, что при создании и репликации голоса используются строгие меры безопасности, включая проверку согласия владельца голоса.
Почему это важно
Эти новые модели открывают широкие возможности для создания уникального и высококачественного аудиоконтента. Способность генерировать голоса с нуля по текстовым описаниям и детально управлять их исполнением значительно упрощает и удешевляет производство аудиоматериалов для различных отраслей. Для разработчиков это означает доступ к мощным инструментам через Google AI Studio и Gemini API, что позволяет интегрировать передовые функции синтеза речи в свои платформы и приложения. Партнерства с такими компаниями, как Figma, HeyGen и Linguana, демонстрируют потенциал моделей в глобальном дубляже, локализации медиа и создании разговорных голосовых агентов.
Что это значит на практике
- Создание уникальных голосовых брендов: Возможность генерировать голоса с нуля позволяет компаниям создавать уникальные и узнаваемые голосовые бренды для своих продуктов и сервисов, отличаясь от конкурентов.
- Эффективный дубляж и локализация: Flash-Lite TTS упрощает высокообъемный дубляж и локализацию контента, позволяя быстро адаптировать аудио для разных регионов с учетом акцентов и нюансов.
- Интерактивные голосовые агенты: Разработчики могут создавать более выразительных и реалистичных голосовых агентов, улучшая пользовательский опыт в чат-ботах, виртуальных помощниках и интерактивных системах.
- Снижение затрат на производство аудио: Автоматизация процесса создания голоса и детальный контроль над его исполнением сокращают необходимость в найме профессиональных актеров озвучивания для каждого проекта.
- Новые возможности для креаторов: Авторы аудиокниг, подкастов и игр получают мощный инструмент для воплощения своих творческих идей, управляя каждым аспектом голосового исполнения.