BookTrans встроил бенчмарк качества перевода для LLM
RUVDS.com встроила в опенсурсный конвейер BookTrans бенчмарк для оценки качества художественного перевода нейросетями. Бенчмарк содержит сто ловушек в одном рассказе и использует LLM-судью с ключом ответов для автоматической проверки.
На нём протестировали модели Anthropic, OpenAI и Google против китайских аналогов. Результаты показывают, насколько хорошо работают западные модели в сравнении с более дешёвыми решениями.
Источник: Хабр — всё
Что мы знаем о компании
Anthropic
- инвестор
- Яан Таллинн
- 370 млн записей россиян утекли в открытый доступ с начала 2026 года 2026-09-23
- 56% CEO не получили доход от ИИ — исследование PwC 2026-09-23
- 8 программ для распознавания текста с фото протестировали на BotHub 2026-09-23
- 80% компаний получили прирост продуктивности от ИИ, но прибыль выросла только у 37% 2026-09-23
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.