Passer au contenu principal
Logiciel, Matériel, OS

SMART : surveiller la santé des HDD et SSD avant la panne

Les disques de stockage ont une particularité inquiétante : ils peuvent fonctionner parfaitement pendant des années, puis commencer à accumuler des erreurs discrètes avant de mourir au moment précis où quelqu’un prononce la phrase :

« Pas besoin de sauvegarde, ce disque n’a jamais eu de problème. »

La technologie S.M.A.R.T., pour Self-Monitoring, Analysis and Reporting Technology, fournit des informations permettant de surveiller la santé, l’usage et certains signes de dégradation d’un périphérique de stockage.

SMART ne répare rien et ne prédit pas toutes les pannes. Il offre surtout des indices permettant d’intervenir avant qu’un disque manifestement malade ne transforme votre sauvegarde inexistante en sujet philosophique.

À quoi sert SMART ?

SMART permet au périphérique de stockage de conserver et d’exposer différentes informations relatives à son fonctionnement. Selon la technologie et le constructeur, on peut notamment obtenir des données concernant :

  • les erreurs de lecture ou d’écriture ;
  • les secteurs réalloués ou instables sur un HDD ;
  • la température ;
  • les heures de fonctionnement ;
  • les cycles d’alimentation ;
  • les erreurs d’interface ;
  • l’usure de la mémoire flash ;
  • les erreurs média ou d’intégrité ;
  • les résultats des autotests internes.

Le principe général est donc :

le disque observe son fonctionnement
↓
son firmware enregistre des compteurs
↓
le système interroge ces données
↓
l'administrateur recherche des anomalies
↓
sauvegarde ou remplacement si nécessaire

La dernière étape est importante. SMART peut vous informer que le navire prend l’eau ; il ne fournit pas automatiquement le canot de sauvetage.

SMART n’est pas identique sur tous les types de stockage

Le terme SMART regroupe aujourd’hui plusieurs mécanismes qui ne présentent pas exactement leurs données de la même façon. Il faut notamment distinguer les disques ATA/SATA, les périphériques SCSI/SAS et les SSD NVMe.

Technologie Informations rencontrées
ATA / SATA Attributs SMART souvent numérotés et largement dépendants du constructeur
SCSI / SAS Pages de logs, compteurs d’erreurs, température et informations de santé
NVMe SMART / Health Information Log standardisé

Cette différence est essentielle : chercher systématiquement un attribut ATA numéro 5 ou 197 sur un NVMe n’a pas beaucoup de sens. Les SSD NVMe possèdent leur propre modèle de télémétrie.

Comprendre les attributs SMART ATA/SATA

Sur un HDD ou SSD ATA, smartctl -A affiche souvent une table contenant notamment :

ID
ATTRIBUTE_NAME
VALUE
WORST
THRESH
TYPE
WHEN_FAILED
RAW_VALUE

Par exemple :

ID# ATTRIBUTE_NAME          VALUE WORST THRESH RAW_VALUE
  5 Reallocated_Sector_Ct    100   100    010   0
  9 Power_On_Hours           095   095    000   4200
194 Temperature_Celsius      067   052    000   33

Il est tentant de lire directement les nombres, mais il faut comprendre ce qu’ils représentent.

RAW_VALUE

La valeur brute représente une donnée interne du périphérique. Elle peut correspondre à un nombre de secteurs, une température, un nombre d’heures ou autre chose.

Mais son format n’est pas universel. Deux constructeurs peuvent utiliser le même numéro d’attribut avec des conventions différentes, et certains champs bruts contiennent même plusieurs valeurs empaquetées ensemble.

VALUE et WORST

VALUE est une valeur normalisée calculée par le firmware du disque. Une valeur élevée est généralement meilleure qu’une valeur basse.

WORST représente la pire valeur normalisée enregistrée, avec quelques particularités selon certains firmwares.

THRESH

THRESH représente le seuil déterminé par le constructeur.

Lorsqu’un attribut soumis à seuil atteint :

VALUE <= THRESH

l’attribut est considéré comme ayant échoué au contrôle correspondant.

Mais cela ne signifie pas qu’un disque dont toutes les valeurs restent au-dessus des seuils est nécessairement sain.

SMART PASSED ne signifie pas « disque parfait »

La commande :

sudo smartctl -H /dev/sda

peut produire quelque chose comme :

SMART overall-health self-assessment test result: PASSED

Cela signifie essentiellement que le périphérique n’a pas déclenché son critère global de panne SMART.

Cela ne signifie pas :

aucun secteur problématique
aucune erreur
aucune dégradation
aucune panne demain
garantie divine de fonctionnement

Un disque peut encore signaler des anomalies préoccupantes tout en annonçant :

PASSED

Il faut donc examiner le rapport dans son ensemble et, surtout, observer son évolution dans le temps.

Les attributs HDD particulièrement intéressants

Les noms et identifiants restent dépendants du matériel, mais plusieurs attributs ATA apparaissent très fréquemment sur les disques durs.

Attribut courant Interprétation générale
Reallocated_Sector_Ct Secteurs défectueux remplacés par des secteurs de réserve
Current_Pending_Sector Secteurs instables dont la lecture n’a pas été fiable et qui attendent une résolution
Offline_Uncorrectable Erreurs de lecture non corrigibles détectées lors de certains contrôles
Power_On_Hours Temps de fonctionnement cumulé selon la convention du fabricant
Power_Cycle_Count Nombre de cycles d’alimentation
Start_Stop_Count Cycles de démarrage et d’arrêt mécanique
Temperature_Celsius Température, lorsque l’attribut utilise effectivement cette convention
UDMA_CRC_Error_Count Erreurs de transmission sur l’interface SATA

Reallocated Sector Count

Un disque dur possède généralement une réserve de secteurs destinés à remplacer certaines zones devenues inutilisables. Lorsqu’un secteur est identifié comme défectueux, le firmware peut le réallouer vers cette réserve.

Un compteur faible et parfaitement stable n’annonce pas nécessairement une panne immédiate. En revanche :

5
↓
18
↓
74
↓
219

sur une courte période constitue une évolution beaucoup plus préoccupante.

La tendance compte souvent davantage qu’une photographie isolée.

Current Pending Sector

Un secteur pending est généralement un secteur dont la lecture a échoué ou s’est révélée instable et dont le sort n’est pas encore complètement déterminé.

Il pourra éventuellement :

  • être relu correctement ;
  • être réécrit avec succès ;
  • être finalement réalloué ;
  • rester problématique.

Des secteurs pending accompagnés d’erreurs de lecture constituent une raison sérieuse de sécuriser immédiatement les données importantes.

UDMA CRC Error Count : parfois le câble, pas le disque

Une augmentation de :

UDMA_CRC_Error_Count

peut indiquer un problème de transmission entre le disque et le contrôleur plutôt qu’une dégradation de la surface du disque.

Les suspects peuvent alors être :

  • le câble SATA ;
  • un connecteur ;
  • le backplane ;
  • l’alimentation ;
  • le contrôleur.

Changer immédiatement le disque parce qu’un compteur CRC augmente sans vérifier le câble permet parfois de remplacer un excellent disque tout en conservant exactement la panne.

Power-On Hours : ce n’est pas un compte à rebours

Power_On_Hours donne une information utile sur l’historique d’utilisation, mais il ne faut pas lire :

50 000 heures
=
mort imminente

Un disque professionnel correctement refroidi peut fonctionner très longtemps. Un disque beaucoup plus jeune peut mourir après quelques mois.

Les heures de fonctionnement doivent donc être interprétées avec :

  • le modèle ;
  • le type d’utilisation ;
  • la température ;
  • les erreurs enregistrées ;
  • l’évolution des autres indicateurs.

La température : pas de valeur magique universelle

On rencontre souvent des affirmations comme :

40 °C = parfait
50 °C = dangereux
60 °C = mort

La réalité est plus nuancée.

Les limites de fonctionnement et les seuils thermiques dépendent du périphérique. La bonne référence reste :

la fiche technique du fabricant

SMART permet surtout de repérer :

  • une température anormalement élevée ;
  • une évolution inhabituelle ;
  • des dépassements documentés ;
  • un refroidissement devenu insuffisant.

Les SSD SATA : mêmes commandes, indicateurs différents

Un SSD SATA peut utiliser le mécanisme d’attributs ATA, mais la signification de nombreux compteurs diffère de celle d’un HDD.

On peut rencontrer selon les constructeurs :

Wear_Leveling_Count
Media_Wearout_Indicator
Percent_Lifetime_Remain
Total_LBAs_Written
Host_Writes
Program_Fail_Count
Erase_Fail_Count

Ces noms ne sont pas universels.

Ne comparez pas directement l’attribut 177 d’un SSD Samsung avec l’attribut 177 d’un autre contrôleur en supposant que l’univers du stockage a enfin choisi la simplicité.

La base de données de smartmontools permet justement d’interpréter correctement de nombreux modèles connus.

NVMe : un modèle de santé plus standardisé

Les SSD NVMe utilisent un SMART / Health Information Log défini par la spécification NVMe.

Parmi les champs particulièrement intéressants :

Champ NVMe Signification
Critical Warning Indique différentes conditions critiques
Temperature Température composite du périphérique
Available Spare Pourcentage de capacité de réserve disponible
Available Spare Threshold Seuil associé à la réserve disponible
Percentage Used Estimation de l’endurance consommée
Data Units Read Quantité de données lues
Data Units Written Quantité de données écrites
Power Cycles Cycles d’alimentation
Power On Hours Heures de fonctionnement
Unsafe Shutdowns Arrêts sans procédure normale
Media and Data Integrity Errors Erreurs concernant le média ou l’intégrité des données

Critical Warning

Le champ :

Critical Warning

est l’un des indicateurs principaux de santé NVMe.

Ses bits peuvent notamment signaler :

  • une réserve disponible passée sous son seuil ;
  • une température hors limites ;
  • une fiabilité dégradée ;
  • un média passé en lecture seule ;
  • un problème de sauvegarde de mémoire volatile sur un périphérique qui en possède une.

Une valeur non nulle mérite donc une investigation immédiate.

Percentage Used : l’indicateur d’endurance NVMe

Pour un SSD NVMe, :

Percentage Used

représente l’estimation du pourcentage de durée de vie nominale de la mémoire non volatile déjà consommé.

Par exemple :

Percentage Used: 13%

indique approximativement que 13 % de l’endurance prévue par le constructeur a été consommée.

Attention toutefois : atteindre :

100 %

ne signifie pas nécessairement que le SSD s’autodétruit à minuit. Cela signifie que l’endurance nominale estimée a été consommée ; la valeur peut même continuer au-delà selon la spécification et l’implémentation.

Lire SMART sous Linux avec smartctl

Le paquet :

smartmontools

fournit principalement :

smartctl
smartd

Sur Debian :

sudo apt install smartmontools

Détecter les périphériques

sudo smartctl --scan-open

Cette commande est particulièrement pratique lorsque plusieurs technologies de stockage sont présentes.

Informations générales

sudo smartctl -i /dev/sda

Elle fournit notamment :

  • modèle ;
  • numéro de série ;
  • firmware ;
  • capacité ;
  • support SMART lorsque pertinent.

État de santé

sudo smartctl -H /dev/sda

Attributs ATA

sudo smartctl -A /dev/sda

Rapport complet

sudo smartctl -x /dev/sda

Pour une investigation sérieuse, -x est souvent plus intéressant qu’une collection de commandes partielles.

Exemple pour un SSD NVMe

Avec smartmontools :

sudo smartctl -x /dev/nvme0

ou selon le besoin :

sudo smartctl -x /dev/nvme0n1

On pourra retrouver un bloc ressemblant à :

SMART overall-health self-assessment test result: PASSED

SMART/Health Information:
Critical Warning:                   0x00
Temperature:                        36 Celsius
Available Spare:                    100%
Available Spare Threshold:          10%
Percentage Used:                    7%
Data Units Read:                    ...
Data Units Written:                 ...
Power Cycles:                       ...
Power On Hours:                     ...
Unsafe Shutdowns:                   ...
Media and Data Integrity Errors:    0

nvme-cli

Pour les périphériques NVMe, l’outil spécialisé :

nvme-cli

permet lui aussi d’interroger directement le contrôleur.

Par exemple :

sudo nvme smart-log /dev/nvme0

ou :

sudo nvme smart-log /dev/nvme0 -H

Selon le type d’investigation, smartctl et nvme-cli sont complémentaires.

Les autotests SMART

De nombreux périphériques prennent en charge des autotests internes permettant à leur firmware d’examiner différentes parties du matériel.

Pour connaître les capacités d’un périphérique ATA :

sudo smartctl -c /dev/sda

On peut notamment y trouver les durées approximatives des tests supportés.

Test court

sudo smartctl -t short /dev/sda

Le programme demande au disque de démarrer le test puis rend généralement la main.

Il faut attendre la durée indiquée avant de consulter le résultat :

sudo smartctl -l selftest /dev/sda

Test long

sudo smartctl -t long /dev/sda

Le test long ou étendu réalise un contrôle beaucoup plus important du média et peut durer :

plusieurs dizaines de minutes
ou
plusieurs heures

selon le périphérique.

Un autotest SMART n’est normalement pas un formatage

Un autotest SMART standard est destiné au diagnostic et ne doit pas effacer les fichiers du disque.

Mais un disque déjà gravement malade peut être soumis à une charge supplémentaire pendant un test approfondi.

Si les données sont irremplaçables et que le périphérique présente déjà des signes sérieux de panne, la priorité est généralement de sécuriser les données avant de lancer une batterie de tests pendant six heures.

Le diagnostic vient après la sauvegarde lorsque la sauvegarde est encore possible.

Lire le journal des autotests

sudo smartctl -l selftest /dev/sda

Un historique peut notamment indiquer :

Completed without error

Completed: read failure

Completed: electrical failure

Interrupted

Aborted by host

Une erreur reproductible au même emplacement mérite évidemment une attention particulière.

Surveillance continue avec smartd

smartd est le démon associé à smartmontools. Il peut surveiller périodiquement les périphériques et enregistrer notamment les changements de santé et différents événements SMART.

Sur Debian, sa configuration se trouve principalement dans :

/etc/smartd.conf

Une configuration très simple peut utiliser :

DEVICESCAN -a

pour demander la détection et la surveillance des périphériques compatibles.

Le service peut ensuite être activé avec :

sudo systemctl enable --now smartmontools

et contrôlé avec :

systemctl status smartmontools

Les notifications externes doivent évidemment être configurées selon l’environnement : journal système, courrier, supervision ou autre infrastructure.

Pourquoi surveiller l’évolution plutôt qu’une seule valeur ?

Une lecture isolée :

Reallocated Sector Count = 4

est moins informative qu’un historique :

1 janvier  : 0
1 février  : 0
1 mars     : 1
8 mars     : 4
9 mars     : 17
10 mars    : 68

La progression indique ici que la situation se dégrade rapidement.

La surveillance permet justement de détecter :

valeur stable
vs
valeur qui dérive brutalement

SMART sous Windows

Des applications graphiques comme CrystalDiskInfo sont très pratiques pour obtenir rapidement :

  • température ;
  • état global ;
  • attributs SMART ;
  • temps de fonctionnement ;
  • informations du périphérique.

Pour une analyse avancée, smartmontools existe également sous Windows.

Windows fournit par ailleurs des informations de fiabilité via son infrastructure de stockage lorsqu’elles sont disponibles.

PowerShell

Pour afficher les disques physiques :

Get-PhysicalDisk

On peut ensuite consulter les compteurs exposés :

Get-PhysicalDisk |
    Get-StorageReliabilityCounter |
    Format-List

Selon le matériel et le pilote, on peut obtenir notamment :

  • température ;
  • usure ;
  • heures de fonctionnement ;
  • cycles de démarrage ;
  • erreurs de lecture ;
  • erreurs d’écriture.

Tous les périphériques ne fournissent pas nécessairement chaque champ.

USB : pourquoi SMART disparaît parfois

Un disque SATA placé dans un boîtier USB n’est plus directement visible comme périphérique SATA par le système. Entre les deux se trouve un pont :

SATA
↓
contrôleur USB-SATA
↓
USB
↓
ordinateur

Pour obtenir SMART, ce pont doit permettre le passage des commandes nécessaires.

Certains le font correctement, d’autres partiellement, et certains pas du tout.

On peut commencer par :

sudo smartctl --scan-open

et, pour certains ponts compatibles SAT :

sudo smartctl -d sat -x /dev/sdX

La bonne option dépend du contrôleur réellement utilisé.

RAID : le disque physique peut être caché

Avec un contrôleur RAID matériel, le système d’exploitation peut ne voir qu’un :

volume logique RAID

alors que les vrais périphériques sont :

Disque 0
Disque 1
Disque 2
Disque 3

Interroger simplement le volume logique peut donc ne pas fournir les données SMART individuelles.

Selon le contrôleur, smartctl possède des options spécifiques permettant d’adresser les disques derrière certaines cartes RAID. Les outils du constructeur peuvent également être nécessaires.

Surveiller uniquement que « le RAID est Optimal » sans regarder l’état des disques physiques revient à surveiller la santé d’un équipage uniquement en regardant si le bateau avance.

SMART n’est pas une sauvegarde

C’est probablement la règle la plus importante.

SMART ne protège pas contre :

  • la suppression accidentelle ;
  • le ransomware ;
  • le vol ;
  • l’incendie ;
  • la panne subite d’un contrôleur ;
  • la surtension ;
  • une erreur administrative ;
  • la perte complète du périphérique sans avertissement préalable.

Un disque peut afficher :

SMART PASSED

à 14 h 00 et ne plus être détecté à 14 h 01.

SMART améliore la surveillance. Il ne modifie pas les lois de la thermodynamique ni la cruauté particulière des pannes électroniques.

Que faire lorsqu’un indicateur devient inquiétant ?

Si les données sont importantes, l’ordre des opérations devrait généralement être :

1. Sauvegarder ou cloner les données importantes

2. Éviter les écritures inutiles

3. Recueillir le rapport SMART complet

4. Vérifier les câbles et l'environnement

5. Examiner les journaux système

6. Effectuer les tests appropriés si le disque reste suffisamment stable

7. Remplacer le périphérique si les indices confirment une dégradation

L’erreur classique consiste à commencer par :

test complet
benchmark
chkdsk
surface scan
défragmentation
benchmark à nouveau

sur un disque qui vient précisément d’annoncer qu’il aimerait prendre sa retraite.

Signaux particulièrement préoccupants

Observation Interprétation possible
Secteurs réalloués en forte augmentation Dégradation du média HDD
Secteurs pending persistants ou croissants Zones devenues difficiles ou impossibles à lire correctement
Erreurs non corrigibles Données que le périphérique n’arrive pas à récupérer normalement
Test SMART long échoué Anomalie matérielle à examiner sérieusement
NVMe Critical Warning non nul Condition critique signalée par le contrôleur
Media and Data Integrity Errors en hausse Erreurs média ou d’intégrité NVMe
Available Spare sous le seuil Réserve NVMe insuffisante
Température hors spécification Problème thermique ou de refroidissement

Signaux à interpréter avec davantage de contexte

Certains compteurs ne justifient pas à eux seuls le remplacement immédiat du disque.

Valeur Pourquoi rester prudent
Power-On Hours élevé Indique surtout l’âge d’utilisation
Start/Stop Count Dépend de l’usage et des spécifications du disque
Température unique Doit être comparée aux limites du fabricant
UDMA CRC Error Count Peut venir du câble ou de l’interface
Attribut brut inconnu Peut utiliser un format propre au constructeur
SSD Percentage Used élevé Indique l’endurance consommée, pas nécessairement une panne immédiate

Les limites fondamentales de SMART

SMART est particulièrement utile pour détecter certains problèmes progressifs, mais il ne possède aucune capacité surnaturelle.

Il peut manquer une panne causée par :

  • une défaillance électronique brutale ;
  • une surtension ;
  • un contrôleur qui cesse soudainement de fonctionner ;
  • une panne mécanique instantanée ;
  • un firmware défectueux ;
  • une connexion défaillante extérieure au disque.

De plus, les attributs ATA sont largement spécifiques aux fabricants. Une valeur brute de :

123456789

peut être catastrophique, parfaitement normale ou simplement impossible à interpréter correctement sans connaître le modèle concerné.

Ne comparez pas aveuglément deux modèles

Cette comparaison :

Disque A :
Raw Read Error Rate = 0

Disque B :
Raw Read Error Rate = 938475920

Conclusion :
Disque B est mort

peut être complètement fausse.

Certains fabricants encodent leurs compteurs bruts de manière particulière. Il faut utiliser :

  • la valeur normalisée ;
  • le seuil ;
  • le modèle du disque ;
  • la documentation du fabricant ;
  • la base de données smartmontools ;
  • l’évolution dans le temps.

SMART et SSD : ne cherchez pas des secteurs comme sur un HDD

Un SSD ne possède pas de plateaux divisés en secteurs physiques au sens mécanique d’un HDD. Son contrôleur gère :

  • pages NAND ;
  • blocs ;
  • wear leveling ;
  • garbage collection ;
  • bad block management ;
  • réserve de capacité ;
  • correction d’erreurs.

Les indicateurs d’usure d’un SSD doivent donc être interprétés selon son architecture.

Pour un NVMe, regardez notamment :

Percentage Used
Available Spare
Critical Warning
Media and Data Integrity Errors
Error Information Log Entries
Temperature

Une valeur d’usure à 100 % ne signifie pas nécessairement disparition immédiate

Le constructeur définit une endurance nominale à partir d’un modèle d’utilisation et de caractéristiques de la NAND.

Atteindre cette valeur signifie plutôt :

endurance nominale consommée

que :

SSD explose dans 30 secondes

Il devient néanmoins particulièrement pertinent de vérifier :

  • la sauvegarde ;
  • les erreurs média ;
  • la réserve disponible ;
  • les avertissements critiques ;
  • la politique de remplacement.

SMART doit faire partie d’une surveillance plus large

Un diagnostic stockage sérieux combine idéalement :

SMART / health logs
+
journaux du système
+
erreurs du contrôleur
+
état RAID
+
température
+
performances
+
tests ciblés
+
sauvegardes vérifiées

Un disque peut être sain mais inaccessible à cause d’un câble. Un RAID peut être dégradé alors que chaque disque encore présent affiche SMART OK. Un système de fichiers peut être corrompu alors que le matériel est en parfait état.

SMART ne remplace donc ni :

  • les logs ;
  • la supervision ;
  • le diagnostic du système de fichiers ;
  • les outils du contrôleur RAID ;
  • les sauvegardes.

Checklist de surveillance

Action Commande ou contrôle
Identifier le périphérique smartctl --scan-open
Voir les informations générales smartctl -i /dev/sdX
Voir la santé globale smartctl -H /dev/sdX
Voir les attributs ATA smartctl -A /dev/sdX
Rapport complet smartctl -x /dev/sdX
Lancer un test court smartctl -t short /dev/sdX
Lancer un test long smartctl -t long /dev/sdX
Historique des autotests smartctl -l selftest /dev/sdX
Santé NVMe smartctl -x /dev/nvme0
Log NVMe natif nvme smart-log /dev/nvme0

Les règles essentielles à retenir

  • SMART fournit des indicateurs de santé et d’usage ; il ne garantit pas qu’une panne sera annoncée à l’avance.
  • Un statut SMART PASSED ne signifie pas que le disque est exempt de problèmes.
  • Les attributs ATA sont largement dépendants du constructeur.
  • Les valeurs brutes ne doivent pas être comparées aveuglément entre modèles.
  • Une valeur normalisée ATA atteignant son seuil constitue un signal beaucoup plus sérieux.
  • Des secteurs réalloués ou pending qui augmentent rapidement sur un HDD sont préoccupants.
  • Un compteur CRC SATA peut signaler un problème de câble plutôt qu’un média défectueux.
  • Power-On Hours est un compteur d’usage, pas un compte à rebours de décès.
  • La température doit être comparée aux spécifications du modèle.
  • Les SSD SATA utilisent des attributs d’usure propres au constructeur.
  • NVMe possède un SMART / Health Information Log standardisé avec notamment Critical Warning et Percentage Used.
  • Percentage Used représente l’endurance NVMe consommée, pas une date exacte de panne.
  • smartctl sait interroger ATA/SATA, SCSI/SAS et NVMe.
  • smartd permet une surveillance continue et la détection d’évolution.
  • Certains boîtiers USB et contrôleurs RAID peuvent masquer ou compliquer l’accès aux informations SMART.
  • Si un disque semble réellement défaillant, sauvegardez d’abord les données importantes avant de lui imposer des tests lourds.
  • SMART n’est jamais un substitut à une sauvegarde.

Conclusion : écoutez le disque avant qu’il ne se taise

SMART est moins un oracle qu’un dossier médical tenu par le firmware du périphérique.

Il peut révéler :

secteurs instables
usure NAND
erreurs média
température anormale
réserve insuffisante
tests échoués
évolution inquiétante

mais il ne possède pas la capacité de prédire toutes les pannes.

La bonne stratégie est donc :

surveiller
↓
historiser
↓
comparer
↓
sauvegarder
↓
remplacer avant la catastrophe lorsque les indices convergent

Ne demandez pas à SMART :

« Mon disque fonctionnera-t-il encore demain à 14 h 37 ? »

Demandez-lui plutôt :

« Est-ce que quelque chose dans ton historique indique que je devrais arrêter de te faire confiance ? »

Et lorsqu’un disque commence à répondre avec des secteurs instables, des erreurs média et un autotest échoué, évitez de lui expliquer que :

SMART dit encore PASSED

Copiez les données.

Le débat philosophique pourra attendre le nouveau disque.