Тэг
llama.cpp
Почему я отказался от платных подписок на ChatGPT и Claude в пользу бесплатной локальной нейросети
Отказ от платных подписок на ChatGPT и Claude в пользу бесплатной локальной нейросети Qwen 3.8-27B на собственном ПК.
Читать далееКак запустить Gemma на сервере: сравнение производительности Ollama и llama.cpp
Сравниваем производительность запуска большой языковой модели Gemma 4 на облачном сервере через Ollama и напрямую через llama.cpp.
Читать далееУскорение визуально-языковых моделей с помощью LFM2.5-VL-DSpark
Обзор новой модели LFM2.5-VL-DSpark от Liquid AI: ускорение визуально-языковых моделей с помощью спекулятивного декодирования, архитектура и инструкции по запуску.
Читать далееРазблокировка PCIe Gen2 x16 на NVIDIA CMP 90HX: от пайки конденсаторов до хака драйвера с помощью ИИ
Подробный гайд по аппаратной и программной модификации NVIDIA CMP 90HX: пайка конденсаторов для PCIe x16, разблокировка режима Gen2 через патч драйвера с ИИ-агентом и тесты скорости в LLM.
Читать далееТестирование DeepSeek, Qwen и GLM на ПК с RTX 5090: подборы инференса, VRAM и драфтеры
Провел масштабный бенчмарк свежих локальных нейросетей DeepSeek, Qwen, GLM и Ornith на топовом пользовательском ПК с RTX 5090 и 192 ГБ ОЗУ. Разбираем реальную скорость, работу MoE и спекулятивное декодирование.
Читать далееУстановка локальных ИИ-моделей в один клик: Nous Research обновила Hermes Desktop
Разработчики из Nous Research выпустили обновление Hermes Desktop с автоматической установкой локальных ИИ-моделей в один клик. Приложение само подбирает параметры, движок llama.cpp и оптимизирует VRAM.
Читать далееТестируем DFlash от Nvidia: почему вместо обещанных 15x мы получаем 2,3x и когда технология бесполезна
Провел детальное тестирование технологии DFlash от Nvidia на видеокарте RTX 6000 PRO. Разбираем, почему вместо обещанного 15-кратного ускорения LLM получается 2,3x при одиночном запросе и просадка при батчинге.
Читать далееУскорение инференса LFM2.5: технология DSpark повышает скорость генерации до 3,2 раз
Интеграция алгоритма спекулятивного декодирования DSpark в модели LFM2.5 от Liquid AI позволила увеличить скорость генерации текста до 3,2 раз как на серверных GPU, так и на локальных устройствах Apple Mac.
Читать далее











