Perplexity оптимизировала embedding-модели на GPU для поиска
Perplexity опубликовала техническое описание инфраструктуры pplx-embed — системы, которая обрабатывает векторные представления текста для поиска и ранжирования. Команда инженеров решила не строить отдельный движок для embedding, а переиспользовала ядра из своего LLM-стека: prefill-ядра для массовой индексации и decode-ядра для запросов в реальном времени.
Оптимизация включила управление CUDA-графами, асинхронное отслеживание результатов и путь обработки запросов на Rust. Решение позволяет балансировать между пропускной способностью при переиндексации и скоростью ответа на поисковые запросы.
Источник: источник
Новости этого рынка выходят у нас в телеграме первыми — @adposium_ai.