Stanford выпустил CLM-8B для выбора действий в агентах вместо генерации
Исследователи Stanford Hazy Research представили CLM-8B — открытую 8-миллиардную модель, которая выбирает оптимальное действие из набора вариантов вместо последовательной генерации токенов. Модель получает состояние среды и возможные действия, затем сравнивает их векторные представления через скалярное произведение.
Обучение использует контрастивную функцию потерь InfoNCE, которая притягивает правильные пары «состояние-действие» и отталкивает неправильные. Базовая реализация построена на Qwen3-8B, код и модели опубликованы открыто.
Источник: Хабр — всё
- Apple и LG разработают экосистему умного дома с замками и камерами 2026-10-07
- Arenadata выпустила Streaming 4.1.0 для обработки потоков данных 2026-10-07
- Браузеры получили встроенные ИИ-функции — исследование показало, как их используют 2026-10-07
- Convai выпустила Laya — модель на 421 млн параметров для классификации текста 2026-10-07
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.