Обзор
GPU
Служба Ollama
Сервер
Модели
Загрузить модель
Модель делит VRAM и вычисления GPU с остальными службами сервера. Квантизация Q4 занимает примерно 0,6 ГБ на миллиард параметров плюс контекст.
Модель делит VRAM и вычисления GPU с остальными службами сервера. Квантизация Q4 занимает примерно 0,6 ГБ на миллиард параметров плюс контекст.