$ grep -r Tag: «cuda»

-rw-r--r-- 7.1K 20 авг. 2026 · BB92431 · ~4 мин

CUDA против Vulkan в llama.cpp на RTX 5080: пять граблей и 21% скорости

cuda nvidia linux llm qwen

После разлочки мощности видеокарты локальная Qwen3.8-27B давала 31 токен в секунду. Потом unsloth перевыпустила тот же квант по новой методике, я перешёл на свежий вариант — стало 35. И я считал это потолком.

Потом прикинул по пропускной способности памяти: карта отдавала 46% возможного. То есть половина простаивала.

Очевидный подозреваемый — Vulkan вместо CUDA. Я это уже пробовал, в те самые двое суток тупиков перед разлочкой мощности. Разницы не было, вопрос закрыл. Оказалось, зря.

[↵] открыть пост cuda-protiv-vulkan-v-llama-cpp-na-rtx-5080.md
makoni@arm1:~/blog$ cd .. // ↵ ко всем постам