Cloud.ru представил облачный сервис Evolution ML Inference

18:16 17.04.2025

Провайдер облачных и AI-технологий Cloud.ru представил Evolution ML Inference – первый в России готовый облачный сервис для инференса (вывода) больших языковых моделей (LLM) с возможностью разделения графических процессоров (GPU) и гибким подходом к утилизации вычислительных ресурсов.

Помимо уже доступных в рамках сервиса Cloud.ru моделей GigaChat бизнес может запускать и развертывать собственные AI-модели и любые ML/DL open source модели из библиотеки Hugging Face на базе облачных GPU в несколько кликов.

Сервис уже доступен для пользователей в режиме General availability и войдет в состав Cloud.ru Evolution AI Factory – готового набора инструментов для работы с AI в облаке, анонсированного на ежегодной конференции GoCloud.

Evolution ML Inference подойдет для компаний и пользователей, которые разрабатывают AI- и ML-решения и хотят быстро и с минимальными затратами запустить собственную ML-модель и персональный конечный продукт для работы. Это полностью управляемый сервис – пользователь только настраивает конфигурацию, модель и тип масштабирования. При этом Cloud.ru предоставляет доступ к мощным графическим процессорам, а также выполняет полное администрирование и обслуживание инфраструктуры.

Ключевые преимущества сервиса:

– Shared GPU – технология позволяет разделять GPU-ресурсы и потреблять то количество vRAM (видеопамяти), которое необходимо для эффективной работы самой модели без задержек, с возможностью динамически перераспределять ресурсы в зависимости от текущих потребностей клиентов. Это повышает утилизацию мощностей в AI-проектах от 15 до 45% в сравнении со сценарием, когда графические процессоры используется полностью;

– простота и гибкость управления сервисом дают возможность, как запускать модели без необходимости сборки образа напрямую из Hugging Face, так и запускать собственные образы со своим окружением;

– решение обеспечивает высокую степень адаптации и рациональное использование доступных ресурсов: на одной видеокарте можно одновременно запускать несколько моделей. Это делает технологию наиболее оптимальной для распределенных систем с разнородной вычислительной инфраструктурой и помогает эффективно масштабировать нагрузку;

– режим скайлирования (эффективного масштабирования) – тарификация за использование модели начинается только в момент обращения к ней.

«По нашим оценкам, около 70% пользователей загружают GPU-ресурсы, зарезервированные под инференс в процессе эксплуатации ML-моделей, менее чем на 55%, – рассказал генеральный директор провайдера облачных и AI-технологий Cloud.ru Евгений Колбин. – При внедрении AI в большинстве случаев базой становится именно среда исполнения модели. Поэтому для получения экономии ресурсов и оптимизации затрат в ходе использовании технологий искусственного интеллекта, особенно GenAI, необходима производительная инфраструктура с гибким масштабированием в реальном времени».

«Глубоко изучив потребности клиентов и наиболее популярные запросы на инфраструктуру и сервисы для AI, мы представили рынку первый управляемый облачный сервис для инференса LLM. С его помощью бизнес может эффективно управлять вычислительными ресурсами в среде с высокой интенсивностью обработки данных. Благодаря размещению Evolution ML Inference в облаке компании могут упростить доступ к AI и сделать использование AI-инструментов проще и удобнее», – добавил Евгений Колбин.

комментарии(0)

Вы можете оставить комментарии.

Комментарии отключены - материал старше 3 дней

Новости

22:15 08.07.2025

Лула да Силва: Недопустимо, чтобы страны размером с Индию и Бразилию не присутствовали в СБ ООН как постоянные члены

301

19:52 08.07.2025

Новые санкции против РФ Трамп рассматривает «очень решительно»

475

18:30 08.07.2025

Китайские геологи обнаружили в провинции Хунань крупные залежи литиевой руды

506

17:40 08.07.2025

Дума приняла закон о запрете начислять проценты за просрочку по кредитам умерших людей

506

17:12 08.07.2025

Оборот биоэквайринга за первое полугодие достиг 72,7 миллиарда рублей

495

17:12 08.07.2025

МУС выдал ордера на арест лидера «Талибана» и главы Верховного суда Афганистана

558

17:00 08.07.2025

Доля российского ПО выросла до 50% — вдвое больше, чем до санкций, заявил Мишустин

505

16:32 08.07.2025

В Восточном Сараеве открыт памятник российскому дипломату Виталию Чуркину

621

16:12 08.07.2025

Фон дер Ляйен перед саммитом ЕС — КНР потребовала от Пекина ограничить сотрудничество с РФ

737

16:00 08.07.2025

Путин отметил исторический пик цены на золото

577

Возврат к списку

Поделиться

Cloud.ru представил облачный сервис Evolution ML Inference

комментарии(0)

Новости

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться

Поделиться