Тестируем новые NVMe-диски на устойчивость к температурным скачкам

Купил новый NVMe-диск, а он через неделю начал жить своей жизнью — то упадёт в скорость, то пропадёт из системы на секунду. Причина может быть не в прошивке и не в сломанном слоте, а в банальной реакции на температуру. В этой статье я расскажу, как сам провожу такие тесты, что смотрю в первую очередь и какие диски ведут себя адекватно, когда рядом — кулер, видеокарта или батарея.

Содержание
  1. Почему NVMe-диски вообще страдают от температуры
  2. Что я подразумеваю под тестом на температурные скачки
  3. Как я организую процесс тестирования
  4. 1. Подготовка стенда и окружение
  5. 2. Базовый замер и мониторинг
  6. 3. Сценарии нагрузки и перепадов
  7. Что я смотрю в первую очередь в логах и метриках
  8. Параметры SMART, которые решают всё
  9. Поведение под нагрузкой
  10. Пример тестового цикла (основа методики)
  11. Как ведут себя разные типы дисков при таких тестах
  12. Условно «холодостойкие» диски
  13. «Средний отряд»
  14. Диск-сюрпризы
  15. Что изменилось после установки радиатора или смены прошивки
  16. Влияние охлаждения
  17. Обновления прошивок
  18. Сценарии: что выбрать под свою ситуацию
  19. Если ты собираешь обычный игровой ПК
  20. Если ты строишь рабочую станцию или домашний сервер
  21. Если ноутбук или компактный корпус с плохим охлаждением
  22. Типичные ошибки при самостоятельной проверке
  23. Как лучше сделать, если нет экспериментальной лаборатории
  24. Сравнительная таблица: на что смотреть при выборе
  25. Несколько практических наблюдений
  26. Итог: что делать обычному пользователю

Почему NVMe-диски вообще страдают от температуры

NVMe — это не просто быстрый интерфейс. Контроллер, NAND и DRAM-кэш на такой компактной плате выделяют много тепла под нагрузкой. При этом у большинства потребительских дисков нет серьёзного охлаждения: тонкая PCB, наклейка-«радиатор» или вообще ничего. Когда температура поднимается выше рабочего диапазона, контроллер включает троттлинг — искусственно снижает частоту и пропускную способность.

Опасен не только нагрев до 70–80°C и выше. Куда хуже — частые перепады: холодный старт, потом резкая нагрузка, потом остывание. В таких условиях быстрее деградируют контакты в разъёме, хуже ведёт себя NAND из-за изменения свойств ячеек, а прошивка может неадекватно реагировать на показания датчиков. Именно поэтому я и начал тестировать новые диски именно на реакцию на температурные скачки, а не просто греть их до отказа.

Что я подразумеваю под тестом на температурные скачки

Это не запуск fio при комнатной температуре и не прогон CrystalDiskMark на ужетёплом диске. Я имитирую реальные условия:

  • резкий подъём температуры от комнатной до рабочей (25 → 55°C) в ходе нагрузки;
  • «пилу» — многократное чередование активного чтения/записи и простоя, когда диск то греется, то остывает;
  • стресс при низкой температуре — включение и нагрузку после того, как диск постоял в холодном состоянии (актуально для ноутбуков и серверов с холодным стартом);
  • тестирование не только интерфейса, но и стабильности видимого для ОС устройства: пропажи из PCIe, ошибок в системном журнале, зависаний.

Если диск выдерживает таких мини-стресс-тестов три-пять дней без сбоев — его можно считать пригодным для систем, где важна надёжность, а не только цифры в бенчмарках.

Как я организую процесс тестирования

1. Подготовка стенда и окружение

Я собираю настендовом ПК или отдельном серверном стенде с возможностью контролировать окружающую температуру хотя бы в двух режимах:

  • Комнатный — 22–25°C, без принудительного обдува диска.
  • Холодный старт — 10–15°C (в холодном помещении или с локальным охлаждением), особенно для ноутбучных сценариев.
  • Нагретый корпус — локальный нагрев зоны диска до 38–42°C окружающего воздуха, имитация того, как греется диск рядом с видеокартой или горячим радиатором VRM.

Сам диск ставлю в оригинальный M.2-слот, без дополнительных радиаторов, чтобы оценить «честное» поведение так, как его увидит обычный пользователь. Датчик температуры беру из SMART и дополнительно термопару на корпус диска для перепроверки.

2. Базовый замер и мониторинг

Перед началом я:

  • получаю SMART-данные (особенно: температура, процент ресурса NAND, количество ошибок коррекции, статус Remap-секторов);
  • записываю версию прошивки, серийный номер и модель контроллера/флеш-памяти;
  • фиксирую скорость в базовом режиме (CRYSTALDISKMARK, fio с быстрым прогоном 4K Q32 и SEQ1M), чтобы потом сравнивать при перепадах температуры.

Мониторинг ведётся непрерывно: SMART раз в минуту, логирование ошибок events от диска, температура во всех точках, наличие упавших линий PCIe и зависаний устройства. Любые резкие падения скорости или пропажи устройства логируются с точностью до секунды.

3. Сценарии нагрузки и перепадов

Я использую несколько основных шаблонов:

  1. «Холодный старт + ударная нагрузка&rastrong>
    • диск охлаждается до ~12–15°C в простое;
    • запуск интенсивной последовательной записи на 60–90 секунд;
    • затем резкий переход в простой на 30–60 секунд.
  2. «Пила&rastrong> — циклическая нагрузка с быстрым остыванием
  3. «Горячий прессинг&rastrong> — длительная нагрузка при стабильно высокой температуре окружающей среды (38–42°C)
  4. «Smoke test&rastrong> — короткие, но частые случайные операции чтения/записи при колебаниях температуры (имитация работы ОС и браузера)

Для автоматизации я обычно использую связку fio, скриптов на bash/powershell и утилиты мониторинга SMART. Важно не просто «нагрузить», а заставить диск именно переходить из холодного в горячее состояние и обратно. Именно тогда видно, насколько адекватно прошивка умеет перестраивать тайминги, частоту и алгоритмы кэширования.

Что я смотрю в первую очередь в логах и метриках

Параметры SMART, которые решают всё

  • Temperature — динамика, скорость роста и разница с окружающей средой.
  • Available Spare — запас резервных ячеек. Если он падает при перепадах, значит, контроллер борется с деградацией.
  • Percentage Used — износ. При критических перепадах может подскочить быстрее обычного.
  • Media and Data Integrity Errors — прямой маркер проблем: диск не справляется с коррекцией ошибок.
  • Error Information Log Entries — количество и частота ошибок. Должно оставаться низким даже после многих циклов.

Поведение под нагрузкой

Кроме цифр в бенчмарках, я смотрю:

  • как быстро восстанавливается скорость после остывания;
  • нет ли резких падений до ноля и повторного «воскрешения» диска;
  • появляется ли подвалинг операций ввода-вывода при нагреве выше определённой точки;
  • как скорость реагирует на изменение температуры датчика и термопары — чтобы понять, где реальный перегрев, а где — запаздывание показаний.

Пример тестового цикла (основа методики)

Ниже упрощённая структура одного полного цикла, который я прогоняю для каждого нового диска:

  1. Подготовка и остаточный сброс статистики
    • Secure Erase или формат низкоуровневый, запись базовых SMART.
  2. Охлаждение до ~15°C и базовые замеры скорости на холодную.
  3. Цикл «Пила&rastrong>
    • 10–20 минут SEQ1M Q8T4 запись, пока температура не выйдет на 60–65°C или выше;
    • 3–5 минут простоя в прохладе (если нужно — обдув), остывание до ~30°C;
    • повторять 3–5 раз.
  4. Холодный старт + стресс — интенсивное 4K Q32T16 случайное чтение/запись после охлаждения до ~15°C.
  5. Длительный прогон при высокой фоновой температуре (38–42°C в зоне диска) — случайный микс 70/30 read/write, 3–5 часов.
  6. Финальные замеры — повтор бенчмарков и сверка SMART до/после.

Как ведут себя разные типы дисков при таких тестах

На основе моего опыта с несколькими десятками моделей и ревизий можно выделить три большие группы. Ниже усреднённая картина, ориентир — а не официальная гарантия от производителей.

Условно «холодостойкие» диски

Обычно это модели с DRAM-буфером, хорошо проработанным контроллером и нормальной термокомпенсацией в прошивке:

  • Correctigon / Samsung OEM-серии с обновлённой прошивкой.
  • Некоторые линейки на базе Phison E18/E21 с качественным охлаждением.
  • TLC/QLC-диски с псевдо-SLC кэшем достаточного объёма и адекватным троттлингом.

Что я наблюдаю:

  • Быстрый старт без температурных ступеней.
  • Скорость просадает плавно по мере нагрева, а не резко.
  • После остывания скорость восстанавливается до исходных значений в пределах 1–2%.
  • Нет пропаданий из системы, нет ошибок Media and Data Integrity.

«Средний отряд»

Основная масса потребительских дисков без DRAM или с урезанным охлаждением. Прошивки часто ориентированы на маркетинговые тесты «холодного старта», а не на долгосрочную стабильность:

  • В начале тестов всё красиво — пиковые скорости, хороие цифры в CDM.
  • На цикле «пилы» появляются заметные просадки и микролаги ввода-вывода.
  • В SMART могут появляться единичные ошибки целостности и расти Error Information Log Entries.
  • При длительном высоком нагреве скорость на 4K-блоках может упасть на 20–40%, что критично для баз данных и систем, активно работающих с мелкими файлами.

Такие диски требуют хотя бы базового радиатора или продуманного продува корпуса.

Диск-сюрпризы

В эту категорию попадали как ранние ревизии с «сырой» прошивкой, так и некоторые QLC-модели с агрессивным троттлингом:

  • При резком перепаде температуры (холодный старт + мгновенная нагрузка) иногда наблюдалось кратковременное отвала диска с повторным появлением в системе.
  • Скорость случайного чтения после серии циклов нагрева/остывания восстанавливалась медленнее, чем хотелось бы.
  • В базе SMART росло число событий ошибок, и даже без видимых сбоев это верный признак, что диск работает на пределе.
  • При повторных стресс-тестах без принудительного остывания — полный провал скорости и зависания потоков ввода-вывода.

После таких наблюдений я либо возвращаю диск как не прошедший тест, либо оставляю только в системы с жёстким контролем охлаждения — и с резервным копированием важных данных.

Что изменилось после установки радиатора или смены прошивки

Влияние охлаждения

Когда я ставлю даже простой медный радиатор и обеспечиво минимальный поток воздуха:

  • средняя рабочая температура под нагрузкой снижается на 5–15°C;
  • разброс температур за цикл становится меньше;
  • восстановление скорости после остывания — почти мгновенное;
  • в SMART обычно стабилизируются Available Spare и количество ошибок.

Это заметно у «среднего отряда». Для хорошего диска радиатор — приятный бонус, но не обязателен. Для слабых — превращает «сырой» продукт во вполне рабочий.

Обновления прошивок

У некоторых моделей после обновления прошивки наблюдались качественные изменения:

  • Более плавная кривая троттлинга: вместо резкого падения скорости — мягкая полка.
  • Лучшая обработка ошибок при переходе из холодного в горячее состояние.
  • Устранены логические баги, которые приводили к временной пропаже устройства.

Я стараюсь брать диск на свежей (или одной из последних) прошивке и прогонять заново. Иногда «плохой» результат — это не диск, а конкретная версия прошивки.

Сценарии: что выбрать под свою ситуацию

Если ты собираешь обычный игровой ПК

Тебе не нужны экстремальные температурные тесты. Тут важнее:

  • стабильная скорость при длительных загрузках и установке игр;
  • отсутствие зависаний в фоне, когда игра пишет кэш или обновляется.

Хороший «средний» диск с DRAM и пассивным радиатором в корпусе с нормальным обдувом — более чем достаточно. Специальные тесты на холодный старт и резкие перепады — опционально.

Если ты строишь рабочую станцию или домашний сервер

Здесь на первый план:

  • надёжность при постоянной циклической нагрузке (бэкапы, виртуалки, кэш);
  • устойчивость к нагреву от соседнего оборудования (дисковые стойки, видеокарты, сетевые карты).

Я смотрю либо на проверенные OEM-линейки от Samsung / Kioxia / WD с серверными корнями, либо на качественные потребительские диски с DRAM и термопастой/радиатором. Обязательно гоню цикл «пилы» и проверяю, не растут ли ошибки целостности.

Если ноутбук или компактный корпус с плохим охлаждением

В таких системах часто:

  • мало места,
  • слабый продув,
  • диск греется от процессора и батареи.

Выбирай диск с:

  • низким энергопотреблением в простое (чтобы меньше грелся);
  • быстрым и плавным троттлингом, а не ступенчатым падением;
  • отсутствием сбоев при длительном простое (важно для ноутов, которые часто живут в режиме гибернации).

Обязательно проверь хотя бы базовый сценарий «холодный старт + сильная нагрузка». Отдельные QLC-диски в таких условиях ведут себя отвратительно.

Типичные ошибки при самостоятельной проверке

  • Тестировать только при комнатной температуре. Это маркетинговый тест, но не инженерный. Нагрев и перепады — главные стрессоры.
  • Игнорировать SMART до/после. Без этих данных непонятно, есть ли деградация на физическом уровне.
  • Доверять одному проходу. Один прогон fio ничего не решает. Минимум 3–5 перепадов за цикл — только после этого можно говорить о стабильности.
  • Отключать все радиаторы и продувы. Полностью «голый» диск — ок, но важно тестить и с реальным охлаждением, сравнивая оба варианта.
  • Не логировать ошибки и зависания, а смотреть только скорость. Диск может не показывать падения скорости в секундах, но внутри прошивки уже сыпаться ошибки коррекции — это видно только в логах.
  • Ставить перегруженный диск в систему без контроля ресурса и запаса по температуре. Если ты заливаешь диск под 95–99% — перепады температур будут влиять сильнее, особенно на QLC/PQLC.
  • Слепо копировать чужие результаты. Одна и та же модель в разных корпусах, с разными прошивками и охлаждением может показывать разное поведение.

Как лучше сделать, если нет экспериментальной лаборатории

Если у тебя нет возможности менять температуру среды и городить сложные стенды — этого и не нужно. Достаточно реальной нагрузки в твоём корпусе и внимательного наблюдения.

  1. Сфокусируйся на SMART и логах.
    • Установи утилиту вроде smartmontools или фирменный софт от вендора диска.
    • Сделай снимок SMART до и после каждого серьёзного стресса (игровая сессия, серия бэкапов, долгая компиляция, монтаж видео).
    • Особенно следи за Media and Data Integrity Errors, количеством событий ошибок и изменением Available Spare.
  2. Запускай реальные тяжелые сценарии вместо только бенчмарков
    • не только CDM, но и fio/DD с длинными записи/чтениями;
    • запуск нескольких виртуалок с активным I/O;
    • длительное копирование сотен гигабайт данных.
  3. Дай диску хотя бы минимальное охлаждение
    • даже простой радиатор заметно улучшает поведение при перепадах;
    • проследи, чтобы рядом не было горячего воздуха от видеокарты в прямом контакте с M.2.
  4. Работай с двумя точками температуры
    • холодная (после ночи и простоя);
    • горячая (после пары часов активной работы).
    • Сделай снимки параметров в этих состояниях и сравни динамику.
  5. Регулярно проверяй ключевые параметры
    • раз в неделю или после серьёзных нагрузок сверяй SMART с первоначальным состоянием;
    • обращай внимание на резкие изменения — любые скачки ошибок это повод задуматься.

Такой подход занимает меньше времени, чем кажется, но даёт реальное понимание, жив ли диск в твоих условиях, а не в тексте маркетинговой брошюры.

Сравнительная таблица: на что смотреть при выборе

Чтобы не копать десятки обзоров, я свёл для себя ключевые ориентиры. Ниже — упрощённая таблица, в которую обычно смотрю при быстрой первичной оценке дисков с точки зрения температурной устойчивости в условиях, близких к реальным.

Параметр Хороший показатель Средний уровень Насторожить, если
Тип памяти TLC с большим псевдо-SLC кэшем или MLC TLC с маленьким кэшем, QLC с умеренным ресурсом QLC с быстрым исчерпанием SLC-кэша при умеренном объёме
DRAM-буфер Есть, объём под 1 ГБ на 1 ТБ ёмкости Нет DRAM, но HMB реализована аккуратно HMB кривой, регулярные при записи мелких блоков
Реакция на нагрев Плавное падение скорости, восстановление без резких скачков Заметные просадки, но без отвалов Резкое падение до ноля, кратковременные отвалы устройства
Поведение после охлаждения Быстрое восстановление скорости, ошибки не накапливаются Восстановление с задержкой (до нескольких секунд), ошибки не критичные Скорость восстанавливается медленно, появляются новые ошибки целостности
SMART после циклов Media and Data Integrity Errors ≈ 0, Available Spare почти не меняется Единичные ошибки, небольшой рост log entries Уверенный рост ошибок, падающий Available Spare

Несколько практических наблюдений

  • Даже «хороший» диск можно убить плохим охлаждением — если он живёт в зоне 50–65°C в простое, пользы от хорошей прошивки будет мало.
  • Дешёвые QLC-диски отлично проходят маркетинговые тесты, но «пилы» и регулярные перепады быстро показывают их предел. Для рабочих машин с важной информацией я их берегу под медиа и игры, не под базы или бэкапы.
  • Прошивки имеют значение не меньше, чем стек флеш-памяти и контроллер. Иногда выигрывает более старая стабильная ревизия, чем свежая с красивыми цифрами, но сырыми алгоритмами.

Итог: что делать обычному пользователю

Хочешь понять, жив ли новый NVMe-диск в твоих условиях:

  • Не ограничивайся однократными бенчмарками. Дай диску хотя бы несколько дней поработать при реальных нагрузках и простоях, фиксируя SMART до и после.
  • Обращай внимание на любые скачки ошибок, кратковременные пропажи устройства и немотивированные просадки скорости. Это первые признаки, что диск тяжело переносит смену температуры.
  • Если тебя беспокоят перегрев и троттлинг, предложи диску хотя бы простейший радиатор и нормальный продув. Это заметно сглаживает скачки и продлевает жизнь NAND.
  • Не полагайся только на «мнение из обзоров». Одно и то же устройство в разных корпусах, ноутбуках и серверном железе может показывать разную устойчивость. Смотри на поведение именно в своей системе.

Температурная устойчивость NVMe-диска — не теоретическая проблема, а вполне практическая, особенно если ты работаешь с важными данными и не любишь сюрпризы в самый неподходящий момент. Пару простых наблюдений и минимальный мониторинг помогут вовремя понять, что диск уже «не тот», и заменить его до того, как сбои приведут к потере данных.

dfncfg.ru — цифровой мир и технологии