GPT-6 Sol и Luna обогнали конкурентов на бенчмарке BitGN
Исследователь Поляков протестировал новые LLM-модели на датасете BitGN с задачами агентов в бизнесе. GPT-6 Sol достигла 100% точности на AI coding задачах и стала самой быстрой моделью в своём ценовом диапазоне, а GPT-6 Luna сдвинула ценовой фронтир. Kimi K3 заняла второе место по точности, но оказалась медленнее и дороже конкурентов.
Claude Opus 5.5 расположилась на 26-м месте из-за частых отказов отвечать. По сравнению с июльским бенчмарком новые модели обеспечивают лучшее качество при меньшей стоимости.
Источник: Поляков считает: AI, код и кейсы
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.