Nvidia выпустила модель для разметки спикеров в аудио на 100 млн параметров
Nvidia открыла веса модели Nemotron 3 Diarization, которая размечает аудиозаписи по говорящим — определяет, кто и когда говорит, включая моменты перебивания. Модель работает на потоке, различает до восьми собеседников (вдвое больше, чем предыдущая версия) и обрабатывает записи неограниченной длины фрагментами по 80 миллисекунд.
Архитектура основана на 31-слойном трансформерном энкодере с RoPE — на выходе модель выдаёт для каждых 10 мс вероятность речи каждого участника. Метки говорящих остаются анонимными, но приложение может связать их с конкретными именами через заранее определённый список спикеров.
Источник: Machinelearning
Что мы знаем о компании
NVIDIA
- инженер
- Даниэль Хан
- Китай производит 1% GPU Nvidia даже с собственной памятью HBM 2026-09-25
- Россия, Казахстан и Беларусь считают вычислительные мощности для ИИ 2026-09-24
- Jensen Huang обещает ИИ спасёт климат после «огромных страданий» 2026-09-24
- NVIDIA выпустила Nemotron 3 Diarization для распознавания говорящих 2026-09-23
- 10 бесплатных AI-агентов для кодинга сравнили по лимитам и моделям 2026-09-25
- 23-летний студент вырастил ИИ-стартап до $2.5 млрд за месяцы 2026-09-25
- 23-летний студент вырастил ИИ-стартап Instinct до $2.5 млрд 2026-09-25
- 54 тысячи лотов Telegram-маркетплейсов не дали арбитражникам прибыль 2026-09-25
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.