Добавлена поддержка Ежчана (
ejchan.net,
ejchan.site). Набегаем, тестируем архивацию,
сообщаем о замеченных проблемах.
К сожалению, значительная часть сохранённых до 2024 г. изображений и видео была потеряна (
подробности случившегося). Мы призываем всех неравнодушных
помочь нам с восстановлением утраченного контента!
Дисклеймер: все события основаны на реальном кейсе борьбы за гарантийный ремонт топового железа в СЦ DNS. Диалоги воспроизведены по памяти, максимально близко к оригиналу, технический абсурд передан без приукрашиваний. Авторское настроение: «мне не смешно».
Отдельно хочу подчеркнуть: к сотрудникам магазина в ТЦ «Мир» (Проспект Октября, 4/1) у меня нет никаких претензий. Там все три заявления приняли спокойно, внимательно проверили формулировки, уточнили нюансы там, где действительно было что уточнить — в общем, отработали именно так, как должен работать нормальный приём документов. Вся эта история — исключительно к сервисному центру на Бакалинской и к конкретному мастеру, который эти два часа звонил, троттлил и сбрасывал трубку.
Представьте ситуацию: вы покупаете бескомпромиссную рабочую станцию. Вся система в сборе приобретается в DNS, там же заказывается сборка. Всё официально и находится на гарантии, кроме одной детали — процессора. Он шёл как OEM, и его годовая гарантия уже благополучно истекла, в то время как на остальные ключевые компоненты (включая дорогущую RTX 4090) гарантия продолжает действовать. Запомните этот факт — вокруг него СЦ построит свою главную защитную стратегию.
В один прекрасный день ваша ультимативная машина превращается в генератор бесконечных аппаратных ошибок шины данных, а мастера из сервисного центра выдвигают техническую гипотезу, достойную Шнобелевской премии по физике. Они заявляют, что пробой PCIe произошёл из‑за троттлинга процессора, который таким образом «убивает» видеокарту. Такое невозможно придумать самому без использования тяжёлых веществ (которые автор статьи категорически осуждает).
В этой статье разберём, почему «волосатый бублик» бессилен против стека ИИ, как контроллер памяти GPU тихо умирает под CUDA‑нагрузкой, и как разворачивался этот комедийный баттл с СЦ DNS.
Заказ-наряд
Рис 1. Заказ‑наряд DNS
Железо и эволюция задач: От Докера к Flux
Системный блок собирался силами специалистов самого магазина DNS из следующих комплектующих:
Материнская плата: MSI MAG Z690 TOMAHAWK WIFI
Процессор: Intel Core i9-12900K OEM (гарантия 1 год, которая уже кончилась)
Кулер для процессора: DEEPCOOL AK620 ZERO DARK [R‑AK620-BKNNMT‑G-1] чёрный
Видеокарта: GIGABYTE GeForce RTX 4090 GAMING OC [GV‑N4090GAMING OC-24GD]
Оперативная память: ADATA XPG Lancer [AX5U5600C3632G‑DCLABK] 64 ГБ
Накопитель: 2000 ГБ M.2 NVMe ADATA LEGEND 960 MAX [ALEG-960M-2TCS]
Блок питания: Thermaltake Toughpower GF3 1200W [PS‑TPD-1200FNFAGE-4] чёрный
Корпус: ARDOR GAMING Rare M1 чёрный
Для чего всё это покупалось? Изначально компьютер брался для игр и комфортной работы по принципу «открыл всё что нужно и никогда не закрываешь». Долгое время компьютер жил в щадящем для видеокарты режиме — в основном нагрузка шла на процессор: среды разработки (IDE), процессы компиляции, Docker и активная виртуализация.
Но примерно 2–3 месяца назад я плотно сел за локальные нейросети. Вот тут‑то и начался настоящий хардкор:
ComfyUI: генерации картинок и видео на тяжёлых весах — Flux1.Dev, Flux2.Dev / Flux2.Klein9B, Wan2.2, LTX (director) и Qwen2512/2511.
Ollama: ИИ‑инференс ассистентов прямо в VS Code через плагины KiloCode и OpenCode (модели Qwen3.6 4Q_K_M и Gemma4 4Q_K_M).
Тензорные ядра и видеопамять (VRAM) начали работать на полную мощность. И тут железо сказало: «Я устало».
Симптомы: «Толстеющая» нейросеть и каскадный сбой
Проблема подкралась незаметно. Система не зависала намертво — сама Windows продолжала дышать, мышка двигалась, браузер открывался. Зависали именно вычисления при генерациях. Запускаешь создание изображения или видео — и процесс уходит в вечное, намертво застывшее вычисление, которое можно было просто отменить кнопкой Cancel в интерфейсе.
Любой профильный специалист скажет, что это — классический маркер самого начала деградации GPU, его ранняя стадия. Ядра CUDA или Tensor спотыкаются о битый сектор памяти, теряют логику адресации и зацикливают исполнение скрипта.
Но дальше начались технические аномалии. При последовательных запусках одна и та же нейросетевая модель начинала занимать разное количество видеопамяти (VRAM) без каких‑либо изменений в параметрах генерации.
В первый запуск модель берёт 10 ГБ VRAM. На второй круг — уже 16 ГБ. На третий — 20 ГБ! Она буквально «кушает», пока я не вижу, и становится толще с каждой итерацией.
Это чистый признак каскадного сбоя банок VRAM и сбоя контроллера памяти внутри самого кристалла GPU, который нарушает деаллокацию (освобождение) памяти.
В системных журналах Windows в этот момент разворачивался сущий ад из логов WHEA‑Logger (критическая аппаратная ошибка шины данных), падений видеодрайвера nvlddmkm и системных ошибок шины PCIe видеокарты: «Uncorrectable Error: 1». В Диспетчере устройств встроенный корневой порт PCIe процессора (Intel PCIe Root Port, VEN_8086&DEV_464F) периодически терял инициализацию или сбоил по питанию.
Картина ясна: видеокарта под нагрузкой начинает слать по шине PCIe мусор, из‑за чего корневой порт процессора (DEV_464F) сходит с ума.
Что на самом деле означает пробой по PCIe от видеокарты
Разложим по фактам, а не по фантазиям сервисного центра. Ошибка WHEA Uncorrectable Error, зафиксированная со стороны видеокарты, — это не разовый глюк и не следствие перегрева процессора. Это сигнал о том, что через линии PCIe уже проходят паразитные токи — утечки на уровне самого кристалла GPU, которые бьют по соседним дорожкам шины и постепенно продавливают их электрическую прочность. Именно это, а не «троттлящий процессор из соседнего сокета», объясняет и плавающую нестабильность инициализации корневого порта PCIe.
Отдельно — история с VRAM, которая «толстеет» от запуска к запуску без единого изменения параметров. Это не мистика и не совпадение: это классический признак сбоя в контроллере деаллокации памяти самого GPU, когда чип перестаёт корректно освобождать банки VRAM после вычислений. Каждый следующий прогон нейросети наслаивается на «мусор», оставшийся от предыдущего — и карта либо занимает всё больше памяти, либо в какой‑то момент просто зависает намертво.
Вместе эти два симптома — не «случайное совпадение двух разных проблем», как удобно думать сервисному центру. Это одна и та же история: латентная деградация полупроводников уже идёт, и идёт она каскадно — сбой на уровне памяти тянет за собой электрическую нестабильность шины, а нестабильность шины ускоряет дальнейшую деградацию кристалла. Это ровно тот случай, когда объективно необходима отдельная углублённая проверка GPU специализированными средствами — а не десять минут в разобранном виде с FurMark, который такие процессы просто не видит в принципе.
Троттлинг процессора к этой картине не имеет никакого отношения — максимум, на что он способен, это уронить частоты и немного снизить производительность. Устроить пробой шины данных троттлинг не может физически, как бы ни хотелось в это верить мастеру сервисного центра.
Дисклеймер: автор — не сертифицированный инженер по полупроводникам, а IT‑специалист с техническим бэкграундом, разбирающий проблему по логам и открытой документации. Но даже дилетантский разбор оказывается точнее версии профессионального сервисного центра — и это уже само по себе диагноз.