Toon posts:

Schijffouten of controllerfouten??

Pagina: 1
Acties:

Verwijderd

Topicstarter
Gisterenavond een poging gedaan op m'n servertje suse 7.2 te upgraden naar suse 7.3
(zeg maar niks, ik weet het :) )

Tijdens de upgrade van het basesystem (geboot vanaf de DVD) ging het een en ander mis, op een gegeven moment bleef de installatie hangen met een brandend hdd lampje. Naar 2e console gegaan, kijken met ps; rpm was bezig een pakketje te installeren, echter ging daar niet echt mee verder (met top geen activiteit ofzo) syslog op console 4 gaf ook geen aanwijzingen.
rpm geprobeert te killen, maar dat wou niet (ook een kill -9 trok ie zich weinig van aan)
Machine gereboot (resetknop) opnieuw geprobeerd... rpm database naar de kloten... die hersteld, rc.config file ook naar de kloten (zat ineens een stuk binaire code en een stuk source code doorheen)
RPM database opnieuw laten aanmaken, rc.config backupje van teruggezet, rest van het basesysteem met de hand geupgrade.
Na een reboot met het nieuwe basesysteem de rest van het systeem geupgrade, waarbij het nog een keer gebeurde dat rpm af en toe bleef hangen, en na een paar minuten weer verder ging :? (uiteindelijk de upgrade wel gelukt)
Ben net even aan het spitten gegaan in /var/log/messages, waarbij ik een paar verontrustende dingen tegenkwam;
Ik kwam ondermeer deze meldingen tegen:
code:
1
2
3
4
Dec  8 20:31:58 (none) kernel: hda: timeout waiting for DMA
Dec  8 20:31:58 (none) kernel: ide_dmaproc: chipset supported ide_dma_timeout func only: 14
Dec  8 20:31:58 (none) kernel: hda: status error: status=0x58 { DriveReady SeekComplete DataRequest }
Dec  8 20:31:58 (none) kernel: hda: drive not ready for command

maar die zie ik wel eens vaker, en dat lijkt verder geen problemen op te leveren, hij zet dma wel eens uit, maar dat kun je gewoon zonder problemen weer aanzetten.

Ik kwam van tijdens die upgrade echter ook deze meldingen tegen, die ik nooit eerder zag:
code:
1
2
3
4
5
6
7
8
9
10
11
Dec  8 20:07:56 (none) kernel: hda: timeout waiting for DMA
Dec  8 20:07:56 (none) kernel: ide_dmaproc: chipset supported ide_dma_timeout func only: 14
Dec  8 20:07:56 (none) kernel: hda: status error: status=0x58 { DriveReady SeekComplete DataRequest }
Dec  8 20:07:56 (none) kernel: hda: drive not ready for command
Dec  8 20:07:56 (none) kernel: hda: timeout waiting for DMA
Dec  8 20:07:56 (none) kernel: ide_dmaproc: chipset supported ide_dma_timeout func only: 14
Dec  8 20:07:56 (none) kernel: hda: status error: status=0x58 { DriveReady SeekComplete DataRequest }
Dec  8 20:07:56 (none) kernel: hda: drive not ready for command
Dec  8 20:13:32 (none) kernel: hda: dma_intr: status=0x51 { DriveReady SeekComplete Error }
Dec  8 20:13:32 (none) kernel: hda: dma_intr: error=0x84 { DriveStatusError BadCRC }
Dec  8 20:23:55 (none) kernel: hda: DMA disabled

Vooral dat stukje BadCRC om 20.13u zint me niet erg...
Ik vraag me nu alleen af waar dit probleem zit... is het de schijf die lees/schrijffouten geeft, of is het de controller?
Als het de schijf is dan gaat die eruit, en installeer ik de zaak maar eens opnieuw op een partitie op de tweede schijf (slackware denk ik zo) maar als het de controller is dan gaat het mainboard eruit (Abit KT7 + Duron800) en gaat het oude mainboard er weer in, met een stabiele 440BX chipset (Aopen AX6BC + Intel P3-450)

Verwijderd

Dergelijke meldingen heb ik ook wel eens gehad. De frequentie nam toe naar mate de tijd vorderde. Uiteindelijk werd het een diskcrash. Maar in hoeverre de VIA controller er mee te maken heeft weet ik niet, ik heb toen ook het moederbord vervangen door een bx. Met de AOpen AX63Pro plank op deze wijze 3 disks om zeep geholpen, en of dat nou aan de sblive of de VIA chipset heeft gelegen weet ik niet. VIA is weg en sblive is er nog en ik heb nu toch al een aantal maanden geen last meer van kapotte disks en fs-corruptie.

Verwijderd

Met hdparm kun je dma uitzetten.
Als dat niet helpt zou ik het niet echt weten.
Misschien een slechte driver of controller, of je schijf is bezig stuk te gaan.

Verwijderd

Topicstarter
Dat dma uitzetten weet ik, en als ie weer eens loopt te bokken, en die melding geeft (doet ie voornamelijk bij heel veel en snelle lees/schrijf acties - voornamelijk bij grote compiles) zet ie zelf dma vaak uit, met als gevolg dat het apparaat stronttraag wordt tijdens schijfverkeer
Voor een servertje dat alleen internettoegang doet is dat niet zo erg, maar deze is behalve dat ook file/web/ftp/database/mail server.
Ik denk dat ik voor de zekerheid toch maar dat andere mainboard er weer in terugzet (p3-450 is snel zat) en slackware installeer op de tweede schijf (zitten twee schijven in, /dev/hda van 13GB en /dev/hdb van 30GB)