Les disques de stockage ont une particularité inquiétante : ils peuvent fonctionner parfaitement pendant des années, puis commencer à accumuler des erreurs discrètes avant de mourir au moment précis où quelqu’un prononce la phrase :
« Pas besoin de sauvegarde, ce disque n’a jamais eu de problème. »
La technologie S.M.A.R.T., pour Self-Monitoring, Analysis and Reporting Technology, fournit des informations permettant de surveiller la santé, l’usage et certains signes de dégradation d’un périphérique de stockage.
SMART ne répare rien et ne prédit pas toutes les pannes. Il offre surtout des indices permettant d’intervenir avant qu’un disque manifestement malade ne transforme votre sauvegarde inexistante en sujet philosophique.
À quoi sert SMART ?
SMART permet au périphérique de stockage de conserver et d’exposer différentes informations relatives à son fonctionnement. Selon la technologie et le constructeur, on peut notamment obtenir des données concernant :
- les erreurs de lecture ou d’écriture ;
- les secteurs réalloués ou instables sur un HDD ;
- la température ;
- les heures de fonctionnement ;
- les cycles d’alimentation ;
- les erreurs d’interface ;
- l’usure de la mémoire flash ;
- les erreurs média ou d’intégrité ;
- les résultats des autotests internes.
Le principe général est donc :
le disque observe son fonctionnement
↓
son firmware enregistre des compteurs
↓
le système interroge ces données
↓
l'administrateur recherche des anomalies
↓
sauvegarde ou remplacement si nécessaire
La dernière étape est importante. SMART peut vous informer que le navire prend l’eau ; il ne fournit pas automatiquement le canot de sauvetage.
SMART n’est pas identique sur tous les types de stockage
Le terme SMART regroupe aujourd’hui plusieurs mécanismes qui ne présentent pas exactement leurs données de la même façon. Il faut notamment distinguer les disques ATA/SATA, les périphériques SCSI/SAS et les SSD NVMe.
| Technologie | Informations rencontrées |
|---|---|
| ATA / SATA | Attributs SMART souvent numérotés et largement dépendants du constructeur |
| SCSI / SAS | Pages de logs, compteurs d’erreurs, température et informations de santé |
| NVMe | SMART / Health Information Log standardisé |
Cette différence est essentielle : chercher systématiquement un attribut ATA numéro 5 ou 197 sur un NVMe n’a pas beaucoup de sens. Les SSD NVMe possèdent leur propre modèle de télémétrie.
Comprendre les attributs SMART ATA/SATA
Sur un HDD ou SSD ATA, smartctl -A affiche souvent une table contenant notamment :
ID
ATTRIBUTE_NAME
VALUE
WORST
THRESH
TYPE
WHEN_FAILED
RAW_VALUE
Par exemple :
ID# ATTRIBUTE_NAME VALUE WORST THRESH RAW_VALUE
5 Reallocated_Sector_Ct 100 100 010 0
9 Power_On_Hours 095 095 000 4200
194 Temperature_Celsius 067 052 000 33
Il est tentant de lire directement les nombres, mais il faut comprendre ce qu’ils représentent.
RAW_VALUE
La valeur brute représente une donnée interne du périphérique. Elle peut correspondre à un nombre de secteurs, une température, un nombre d’heures ou autre chose.
Mais son format n’est pas universel. Deux constructeurs peuvent utiliser le même numéro d’attribut avec des conventions différentes, et certains champs bruts contiennent même plusieurs valeurs empaquetées ensemble.
VALUE et WORST
VALUE est une valeur normalisée calculée par le firmware du disque. Une valeur élevée est généralement meilleure qu’une valeur basse.
WORST représente la pire valeur normalisée enregistrée, avec quelques particularités selon certains firmwares.
THRESH
THRESH représente le seuil déterminé par le constructeur.
Lorsqu’un attribut soumis à seuil atteint :
VALUE <= THRESH
l’attribut est considéré comme ayant échoué au contrôle correspondant.
Mais cela ne signifie pas qu’un disque dont toutes les valeurs restent au-dessus des seuils est nécessairement sain.
SMART PASSED ne signifie pas « disque parfait »
La commande :
sudo smartctl -H /dev/sda
peut produire quelque chose comme :
SMART overall-health self-assessment test result: PASSED
Cela signifie essentiellement que le périphérique n’a pas déclenché son critère global de panne SMART.
Cela ne signifie pas :
aucun secteur problématique
aucune erreur
aucune dégradation
aucune panne demain
garantie divine de fonctionnement
Un disque peut encore signaler des anomalies préoccupantes tout en annonçant :
PASSED
Il faut donc examiner le rapport dans son ensemble et, surtout, observer son évolution dans le temps.
Les attributs HDD particulièrement intéressants
Les noms et identifiants restent dépendants du matériel, mais plusieurs attributs ATA apparaissent très fréquemment sur les disques durs.
| Attribut courant | Interprétation générale |
|---|---|
Reallocated_Sector_Ct |
Secteurs défectueux remplacés par des secteurs de réserve |
Current_Pending_Sector |
Secteurs instables dont la lecture n’a pas été fiable et qui attendent une résolution |
Offline_Uncorrectable |
Erreurs de lecture non corrigibles détectées lors de certains contrôles |
Power_On_Hours |
Temps de fonctionnement cumulé selon la convention du fabricant |
Power_Cycle_Count |
Nombre de cycles d’alimentation |
Start_Stop_Count |
Cycles de démarrage et d’arrêt mécanique |
Temperature_Celsius |
Température, lorsque l’attribut utilise effectivement cette convention |
UDMA_CRC_Error_Count |
Erreurs de transmission sur l’interface SATA |
Reallocated Sector Count
Un disque dur possède généralement une réserve de secteurs destinés à remplacer certaines zones devenues inutilisables. Lorsqu’un secteur est identifié comme défectueux, le firmware peut le réallouer vers cette réserve.
Un compteur faible et parfaitement stable n’annonce pas nécessairement une panne immédiate. En revanche :
5
↓
18
↓
74
↓
219
sur une courte période constitue une évolution beaucoup plus préoccupante.
La tendance compte souvent davantage qu’une photographie isolée.
Current Pending Sector
Un secteur pending est généralement un secteur dont la lecture a échoué ou s’est révélée instable et dont le sort n’est pas encore complètement déterminé.
Il pourra éventuellement :
- être relu correctement ;
- être réécrit avec succès ;
- être finalement réalloué ;
- rester problématique.
Des secteurs pending accompagnés d’erreurs de lecture constituent une raison sérieuse de sécuriser immédiatement les données importantes.
UDMA CRC Error Count : parfois le câble, pas le disque
Une augmentation de :
UDMA_CRC_Error_Count
peut indiquer un problème de transmission entre le disque et le contrôleur plutôt qu’une dégradation de la surface du disque.
Les suspects peuvent alors être :
- le câble SATA ;
- un connecteur ;
- le backplane ;
- l’alimentation ;
- le contrôleur.
Changer immédiatement le disque parce qu’un compteur CRC augmente sans vérifier le câble permet parfois de remplacer un excellent disque tout en conservant exactement la panne.
Power-On Hours : ce n’est pas un compte à rebours
Power_On_Hours donne une information utile sur l’historique d’utilisation, mais il ne faut pas lire :
50 000 heures
=
mort imminente
Un disque professionnel correctement refroidi peut fonctionner très longtemps. Un disque beaucoup plus jeune peut mourir après quelques mois.
Les heures de fonctionnement doivent donc être interprétées avec :
- le modèle ;
- le type d’utilisation ;
- la température ;
- les erreurs enregistrées ;
- l’évolution des autres indicateurs.
La température : pas de valeur magique universelle
On rencontre souvent des affirmations comme :
40 °C = parfait
50 °C = dangereux
60 °C = mort
La réalité est plus nuancée.
Les limites de fonctionnement et les seuils thermiques dépendent du périphérique. La bonne référence reste :
la fiche technique du fabricant
SMART permet surtout de repérer :
- une température anormalement élevée ;
- une évolution inhabituelle ;
- des dépassements documentés ;
- un refroidissement devenu insuffisant.
Les SSD SATA : mêmes commandes, indicateurs différents
Un SSD SATA peut utiliser le mécanisme d’attributs ATA, mais la signification de nombreux compteurs diffère de celle d’un HDD.
On peut rencontrer selon les constructeurs :
Wear_Leveling_Count
Media_Wearout_Indicator
Percent_Lifetime_Remain
Total_LBAs_Written
Host_Writes
Program_Fail_Count
Erase_Fail_Count
Ces noms ne sont pas universels.
Ne comparez pas directement l’attribut 177 d’un SSD Samsung avec l’attribut 177 d’un autre contrôleur en supposant que l’univers du stockage a enfin choisi la simplicité.
La base de données de smartmontools permet justement d’interpréter correctement de nombreux modèles connus.
NVMe : un modèle de santé plus standardisé
Les SSD NVMe utilisent un SMART / Health Information Log défini par la spécification NVMe.
Parmi les champs particulièrement intéressants :
| Champ NVMe | Signification |
|---|---|
Critical Warning |
Indique différentes conditions critiques |
Temperature |
Température composite du périphérique |
Available Spare |
Pourcentage de capacité de réserve disponible |
Available Spare Threshold |
Seuil associé à la réserve disponible |
Percentage Used |
Estimation de l’endurance consommée |
Data Units Read |
Quantité de données lues |
Data Units Written |
Quantité de données écrites |
Power Cycles |
Cycles d’alimentation |
Power On Hours |
Heures de fonctionnement |
Unsafe Shutdowns |
Arrêts sans procédure normale |
Media and Data Integrity Errors |
Erreurs concernant le média ou l’intégrité des données |
Critical Warning
Le champ :
Critical Warning
est l’un des indicateurs principaux de santé NVMe.
Ses bits peuvent notamment signaler :
- une réserve disponible passée sous son seuil ;
- une température hors limites ;
- une fiabilité dégradée ;
- un média passé en lecture seule ;
- un problème de sauvegarde de mémoire volatile sur un périphérique qui en possède une.
Une valeur non nulle mérite donc une investigation immédiate.
Percentage Used : l’indicateur d’endurance NVMe
Pour un SSD NVMe, :
Percentage Used
représente l’estimation du pourcentage de durée de vie nominale de la mémoire non volatile déjà consommé.
Par exemple :
Percentage Used: 13%
indique approximativement que 13 % de l’endurance prévue par le constructeur a été consommée.
Attention toutefois : atteindre :
100 %
ne signifie pas nécessairement que le SSD s’autodétruit à minuit. Cela signifie que l’endurance nominale estimée a été consommée ; la valeur peut même continuer au-delà selon la spécification et l’implémentation.
Lire SMART sous Linux avec smartctl
Le paquet :
smartmontools
fournit principalement :
smartctl
smartd
Sur Debian :
sudo apt install smartmontools
Détecter les périphériques
sudo smartctl --scan-open
Cette commande est particulièrement pratique lorsque plusieurs technologies de stockage sont présentes.
Informations générales
sudo smartctl -i /dev/sda
Elle fournit notamment :
- modèle ;
- numéro de série ;
- firmware ;
- capacité ;
- support SMART lorsque pertinent.
État de santé
sudo smartctl -H /dev/sda
Attributs ATA
sudo smartctl -A /dev/sda
Rapport complet
sudo smartctl -x /dev/sda
Pour une investigation sérieuse, -x est souvent plus intéressant qu’une collection de commandes partielles.
Exemple pour un SSD NVMe
Avec smartmontools :
sudo smartctl -x /dev/nvme0
ou selon le besoin :
sudo smartctl -x /dev/nvme0n1
On pourra retrouver un bloc ressemblant à :
SMART overall-health self-assessment test result: PASSED
SMART/Health Information:
Critical Warning: 0x00
Temperature: 36 Celsius
Available Spare: 100%
Available Spare Threshold: 10%
Percentage Used: 7%
Data Units Read: ...
Data Units Written: ...
Power Cycles: ...
Power On Hours: ...
Unsafe Shutdowns: ...
Media and Data Integrity Errors: 0
nvme-cli
Pour les périphériques NVMe, l’outil spécialisé :
nvme-cli
permet lui aussi d’interroger directement le contrôleur.
Par exemple :
sudo nvme smart-log /dev/nvme0
ou :
sudo nvme smart-log /dev/nvme0 -H
Selon le type d’investigation, smartctl et nvme-cli sont complémentaires.
Les autotests SMART
De nombreux périphériques prennent en charge des autotests internes permettant à leur firmware d’examiner différentes parties du matériel.
Pour connaître les capacités d’un périphérique ATA :
sudo smartctl -c /dev/sda
On peut notamment y trouver les durées approximatives des tests supportés.
Test court
sudo smartctl -t short /dev/sda
Le programme demande au disque de démarrer le test puis rend généralement la main.
Il faut attendre la durée indiquée avant de consulter le résultat :
sudo smartctl -l selftest /dev/sda
Test long
sudo smartctl -t long /dev/sda
Le test long ou étendu réalise un contrôle beaucoup plus important du média et peut durer :
plusieurs dizaines de minutes
ou
plusieurs heures
selon le périphérique.
Un autotest SMART n’est normalement pas un formatage
Un autotest SMART standard est destiné au diagnostic et ne doit pas effacer les fichiers du disque.
Mais un disque déjà gravement malade peut être soumis à une charge supplémentaire pendant un test approfondi.
Si les données sont irremplaçables et que le périphérique présente déjà des signes sérieux de panne, la priorité est généralement de sécuriser les données avant de lancer une batterie de tests pendant six heures.
Le diagnostic vient après la sauvegarde lorsque la sauvegarde est encore possible.
Lire le journal des autotests
sudo smartctl -l selftest /dev/sda
Un historique peut notamment indiquer :
Completed without error
Completed: read failure
Completed: electrical failure
Interrupted
Aborted by host
Une erreur reproductible au même emplacement mérite évidemment une attention particulière.
Surveillance continue avec smartd
smartd est le démon associé à smartmontools. Il peut surveiller périodiquement les périphériques et enregistrer notamment les changements de santé et différents événements SMART.
Sur Debian, sa configuration se trouve principalement dans :
/etc/smartd.conf
Une configuration très simple peut utiliser :
DEVICESCAN -a
pour demander la détection et la surveillance des périphériques compatibles.
Le service peut ensuite être activé avec :
sudo systemctl enable --now smartmontools
et contrôlé avec :
systemctl status smartmontools
Les notifications externes doivent évidemment être configurées selon l’environnement : journal système, courrier, supervision ou autre infrastructure.
Pourquoi surveiller l’évolution plutôt qu’une seule valeur ?
Une lecture isolée :
Reallocated Sector Count = 4
est moins informative qu’un historique :
1 janvier : 0
1 février : 0
1 mars : 1
8 mars : 4
9 mars : 17
10 mars : 68
La progression indique ici que la situation se dégrade rapidement.
La surveillance permet justement de détecter :
valeur stable
vs
valeur qui dérive brutalement
SMART sous Windows
Des applications graphiques comme CrystalDiskInfo sont très pratiques pour obtenir rapidement :
- température ;
- état global ;
- attributs SMART ;
- temps de fonctionnement ;
- informations du périphérique.
Pour une analyse avancée, smartmontools existe également sous Windows.
Windows fournit par ailleurs des informations de fiabilité via son infrastructure de stockage lorsqu’elles sont disponibles.
PowerShell
Pour afficher les disques physiques :
Get-PhysicalDisk
On peut ensuite consulter les compteurs exposés :
Get-PhysicalDisk |
Get-StorageReliabilityCounter |
Format-List
Selon le matériel et le pilote, on peut obtenir notamment :
- température ;
- usure ;
- heures de fonctionnement ;
- cycles de démarrage ;
- erreurs de lecture ;
- erreurs d’écriture.
Tous les périphériques ne fournissent pas nécessairement chaque champ.
USB : pourquoi SMART disparaît parfois
Un disque SATA placé dans un boîtier USB n’est plus directement visible comme périphérique SATA par le système. Entre les deux se trouve un pont :
SATA
↓
contrôleur USB-SATA
↓
USB
↓
ordinateur
Pour obtenir SMART, ce pont doit permettre le passage des commandes nécessaires.
Certains le font correctement, d’autres partiellement, et certains pas du tout.
On peut commencer par :
sudo smartctl --scan-open
et, pour certains ponts compatibles SAT :
sudo smartctl -d sat -x /dev/sdX
La bonne option dépend du contrôleur réellement utilisé.
RAID : le disque physique peut être caché
Avec un contrôleur RAID matériel, le système d’exploitation peut ne voir qu’un :
volume logique RAID
alors que les vrais périphériques sont :
Disque 0
Disque 1
Disque 2
Disque 3
Interroger simplement le volume logique peut donc ne pas fournir les données SMART individuelles.
Selon le contrôleur, smartctl possède des options spécifiques permettant d’adresser les disques derrière certaines cartes RAID. Les outils du constructeur peuvent également être nécessaires.
Surveiller uniquement que « le RAID est Optimal » sans regarder l’état des disques physiques revient à surveiller la santé d’un équipage uniquement en regardant si le bateau avance.
SMART n’est pas une sauvegarde
C’est probablement la règle la plus importante.
SMART ne protège pas contre :
- la suppression accidentelle ;
- le ransomware ;
- le vol ;
- l’incendie ;
- la panne subite d’un contrôleur ;
- la surtension ;
- une erreur administrative ;
- la perte complète du périphérique sans avertissement préalable.
Un disque peut afficher :
SMART PASSED
à 14 h 00 et ne plus être détecté à 14 h 01.
SMART améliore la surveillance. Il ne modifie pas les lois de la thermodynamique ni la cruauté particulière des pannes électroniques.
Que faire lorsqu’un indicateur devient inquiétant ?
Si les données sont importantes, l’ordre des opérations devrait généralement être :
1. Sauvegarder ou cloner les données importantes
2. Éviter les écritures inutiles
3. Recueillir le rapport SMART complet
4. Vérifier les câbles et l'environnement
5. Examiner les journaux système
6. Effectuer les tests appropriés si le disque reste suffisamment stable
7. Remplacer le périphérique si les indices confirment une dégradation
L’erreur classique consiste à commencer par :
test complet
benchmark
chkdsk
surface scan
défragmentation
benchmark à nouveau
sur un disque qui vient précisément d’annoncer qu’il aimerait prendre sa retraite.
Signaux particulièrement préoccupants
| Observation | Interprétation possible |
|---|---|
| Secteurs réalloués en forte augmentation | Dégradation du média HDD |
| Secteurs pending persistants ou croissants | Zones devenues difficiles ou impossibles à lire correctement |
| Erreurs non corrigibles | Données que le périphérique n’arrive pas à récupérer normalement |
| Test SMART long échoué | Anomalie matérielle à examiner sérieusement |
| NVMe Critical Warning non nul | Condition critique signalée par le contrôleur |
| Media and Data Integrity Errors en hausse | Erreurs média ou d’intégrité NVMe |
| Available Spare sous le seuil | Réserve NVMe insuffisante |
| Température hors spécification | Problème thermique ou de refroidissement |
Signaux à interpréter avec davantage de contexte
Certains compteurs ne justifient pas à eux seuls le remplacement immédiat du disque.
| Valeur | Pourquoi rester prudent |
|---|---|
| Power-On Hours élevé | Indique surtout l’âge d’utilisation |
| Start/Stop Count | Dépend de l’usage et des spécifications du disque |
| Température unique | Doit être comparée aux limites du fabricant |
| UDMA CRC Error Count | Peut venir du câble ou de l’interface |
| Attribut brut inconnu | Peut utiliser un format propre au constructeur |
| SSD Percentage Used élevé | Indique l’endurance consommée, pas nécessairement une panne immédiate |
Les limites fondamentales de SMART
SMART est particulièrement utile pour détecter certains problèmes progressifs, mais il ne possède aucune capacité surnaturelle.
Il peut manquer une panne causée par :
- une défaillance électronique brutale ;
- une surtension ;
- un contrôleur qui cesse soudainement de fonctionner ;
- une panne mécanique instantanée ;
- un firmware défectueux ;
- une connexion défaillante extérieure au disque.
De plus, les attributs ATA sont largement spécifiques aux fabricants. Une valeur brute de :
123456789
peut être catastrophique, parfaitement normale ou simplement impossible à interpréter correctement sans connaître le modèle concerné.
Ne comparez pas aveuglément deux modèles
Cette comparaison :
Disque A :
Raw Read Error Rate = 0
Disque B :
Raw Read Error Rate = 938475920
Conclusion :
Disque B est mort
peut être complètement fausse.
Certains fabricants encodent leurs compteurs bruts de manière particulière. Il faut utiliser :
- la valeur normalisée ;
- le seuil ;
- le modèle du disque ;
- la documentation du fabricant ;
- la base de données smartmontools ;
- l’évolution dans le temps.
SMART et SSD : ne cherchez pas des secteurs comme sur un HDD
Un SSD ne possède pas de plateaux divisés en secteurs physiques au sens mécanique d’un HDD. Son contrôleur gère :
- pages NAND ;
- blocs ;
- wear leveling ;
- garbage collection ;
- bad block management ;
- réserve de capacité ;
- correction d’erreurs.
Les indicateurs d’usure d’un SSD doivent donc être interprétés selon son architecture.
Pour un NVMe, regardez notamment :
Percentage Used
Available Spare
Critical Warning
Media and Data Integrity Errors
Error Information Log Entries
Temperature
Une valeur d’usure à 100 % ne signifie pas nécessairement disparition immédiate
Le constructeur définit une endurance nominale à partir d’un modèle d’utilisation et de caractéristiques de la NAND.
Atteindre cette valeur signifie plutôt :
endurance nominale consommée
que :
SSD explose dans 30 secondes
Il devient néanmoins particulièrement pertinent de vérifier :
- la sauvegarde ;
- les erreurs média ;
- la réserve disponible ;
- les avertissements critiques ;
- la politique de remplacement.
SMART doit faire partie d’une surveillance plus large
Un diagnostic stockage sérieux combine idéalement :
SMART / health logs
+
journaux du système
+
erreurs du contrôleur
+
état RAID
+
température
+
performances
+
tests ciblés
+
sauvegardes vérifiées
Un disque peut être sain mais inaccessible à cause d’un câble. Un RAID peut être dégradé alors que chaque disque encore présent affiche SMART OK. Un système de fichiers peut être corrompu alors que le matériel est en parfait état.
SMART ne remplace donc ni :
- les logs ;
- la supervision ;
- le diagnostic du système de fichiers ;
- les outils du contrôleur RAID ;
- les sauvegardes.
Checklist de surveillance
| Action | Commande ou contrôle |
|---|---|
| Identifier le périphérique | smartctl --scan-open |
| Voir les informations générales | smartctl -i /dev/sdX |
| Voir la santé globale | smartctl -H /dev/sdX |
| Voir les attributs ATA | smartctl -A /dev/sdX |
| Rapport complet | smartctl -x /dev/sdX |
| Lancer un test court | smartctl -t short /dev/sdX |
| Lancer un test long | smartctl -t long /dev/sdX |
| Historique des autotests | smartctl -l selftest /dev/sdX |
| Santé NVMe | smartctl -x /dev/nvme0 |
| Log NVMe natif | nvme smart-log /dev/nvme0 |
Les règles essentielles à retenir
- SMART fournit des indicateurs de santé et d’usage ; il ne garantit pas qu’une panne sera annoncée à l’avance.
- Un statut SMART PASSED ne signifie pas que le disque est exempt de problèmes.
- Les attributs ATA sont largement dépendants du constructeur.
- Les valeurs brutes ne doivent pas être comparées aveuglément entre modèles.
- Une valeur normalisée ATA atteignant son seuil constitue un signal beaucoup plus sérieux.
- Des secteurs réalloués ou pending qui augmentent rapidement sur un HDD sont préoccupants.
- Un compteur CRC SATA peut signaler un problème de câble plutôt qu’un média défectueux.
- Power-On Hours est un compteur d’usage, pas un compte à rebours de décès.
- La température doit être comparée aux spécifications du modèle.
- Les SSD SATA utilisent des attributs d’usure propres au constructeur.
- NVMe possède un SMART / Health Information Log standardisé avec notamment Critical Warning et Percentage Used.
- Percentage Used représente l’endurance NVMe consommée, pas une date exacte de panne.
- smartctl sait interroger ATA/SATA, SCSI/SAS et NVMe.
- smartd permet une surveillance continue et la détection d’évolution.
- Certains boîtiers USB et contrôleurs RAID peuvent masquer ou compliquer l’accès aux informations SMART.
- Si un disque semble réellement défaillant, sauvegardez d’abord les données importantes avant de lui imposer des tests lourds.
- SMART n’est jamais un substitut à une sauvegarde.
Conclusion : écoutez le disque avant qu’il ne se taise
SMART est moins un oracle qu’un dossier médical tenu par le firmware du périphérique.
Il peut révéler :
secteurs instables
usure NAND
erreurs média
température anormale
réserve insuffisante
tests échoués
évolution inquiétante
mais il ne possède pas la capacité de prédire toutes les pannes.
La bonne stratégie est donc :
surveiller
↓
historiser
↓
comparer
↓
sauvegarder
↓
remplacer avant la catastrophe lorsque les indices convergent
Ne demandez pas à SMART :
« Mon disque fonctionnera-t-il encore demain à 14 h 37 ? »
Demandez-lui plutôt :
« Est-ce que quelque chose dans ton historique indique que je devrais arrêter de te faire confiance ? »
Et lorsqu’un disque commence à répondre avec des secteurs instables, des erreurs média et un autotest échoué, évitez de lui expliquer que :
SMART dit encore PASSED
Copiez les données.
Le débat philosophique pourra attendre le nouveau disque.
