Локальный LLM сервер

В этом разделе представлена информация о требованиях к памяти GPU, требуемой для разворачивания локального LLM-сервера. А также инструкции по установке и настройке инструментов:

  • Ollama — программное средство с открытым исходным кодом для запуска и управления большими языковыми моделями на локальном оборудовании. Обеспечивает полный цикл работы с моделью: загрузку, запуск и взаимодействие через командную строку или REST API. Ollama ориентирована на упрощение развертывания LLM.

  • vLLM — высокопроизводительная библиотека с открытым исходным кодом для инференса и обслуживания больших языковых моделей. Использует алгоритм PagedAttention, который обеспечивает эффективное управление памятью KV-кэша и применение непрерывного пакетирования для достижения максимальной пропускной способности. vLLM ориентирована на эксплуатацию в производственных средах с высокими требованиями к производительности.