Ik heb sinds bijna 2 weken een eigen colocated server. Nu was er vorige week maandag ochtend om een uur of 10:52 een heel vreemd probleem: De server was compleet onbereikbaar. Een reboot de volgende dag loste het probleem op. Vandaag (ook maandag) ook om ongeveer 10:52 bijna hetzelfde probleem. Pings van 2 tot 4 seconden en soms timeouts. Om 3 minuten voor 7 was de server helemaal niet bereikbaar en loste een reboot van het systeem het probleem op (zie onderstaand stuk).
Er zijn geen vreemde processen opgestart, de load is bijna 0, en datatraffic is verwaarloosbaar weinig. Andere servers die op de zelfde switch zijn aangesloten zijn wel prima bereikbaar. De provider heeft de kabels omgewisseld, maar dat hielp niet. Zoals gezegd loste een reboot het probleem op.
Wel erg opmerkelijk vond ik de melding in de message log onder mijn linux server. Dit is trouwens gebeurd toen de provider de kabels ed aan het verwisselen was.
Jul 22 18:57:40 apollo kernel: eth0: Updating statistics failed, disabling stats as an interrupt source.
Jul 22 18:57:40 apollo kernel: eth0: Transmit error, Tx status register ff.
Jul 22 18:57:40 apollo kernel: Flags; bus-master 1, dirty 145082(10) current 145082(10)
Jul 22 18:57:40 apollo kernel: Transmit list ffffffff vs. ca442480.
Jul 22 18:57:40 apollo kernel: 0: @ca442200 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 1: @ca442240 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 2: @ca442280 length 80000062 status 00010062
.....(een paar keer ongeveer hetzelfde)
80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 15: @ca4425c0 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: eth0: Host error, FIFO diagnostic register ffff.
Jul 22 18:57:40 apollo kernel: eth0: PCI bus error, bus status ffffffff
Jul 22 18:58:43 apollo kernel: eth0: Setting full-duplex based on MII #24 link partner capability of 45e1.
Jul 22 19:05:52 apollo syslogd 1.4.1: restart.
Dit bovenstaande heeft eigenlijk niets te maken met het feit dat de server de hele dag slecht bereikbaar was (en vorige week maandag ook), maar dit is ook niet echt goed. Vorige week had ik deze medlingen trouwens niet!
Hoe kan ik dit probleem aanpakken? Het vreemde is dus dat ik 2 keer ongeveer hetzelfde probleem heb op maandagochtend. Moet ik gewoon een nieuwe netwerkkaart proberen of kan het probleem ook elders liggen?
Er zijn geen vreemde processen opgestart, de load is bijna 0, en datatraffic is verwaarloosbaar weinig. Andere servers die op de zelfde switch zijn aangesloten zijn wel prima bereikbaar. De provider heeft de kabels omgewisseld, maar dat hielp niet. Zoals gezegd loste een reboot het probleem op.
Wel erg opmerkelijk vond ik de melding in de message log onder mijn linux server. Dit is trouwens gebeurd toen de provider de kabels ed aan het verwisselen was.
Jul 22 18:57:40 apollo kernel: eth0: Updating statistics failed, disabling stats as an interrupt source.
Jul 22 18:57:40 apollo kernel: eth0: Transmit error, Tx status register ff.
Jul 22 18:57:40 apollo kernel: Flags; bus-master 1, dirty 145082(10) current 145082(10)
Jul 22 18:57:40 apollo kernel: Transmit list ffffffff vs. ca442480.
Jul 22 18:57:40 apollo kernel: 0: @ca442200 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 1: @ca442240 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 2: @ca442280 length 80000062 status 00010062
.....(een paar keer ongeveer hetzelfde)
80000062 status 00010062
Jul 22 18:57:40 apollo kernel: 15: @ca4425c0 length 80000062 status 00010062
Jul 22 18:57:40 apollo kernel: eth0: Host error, FIFO diagnostic register ffff.
Jul 22 18:57:40 apollo kernel: eth0: PCI bus error, bus status ffffffff
Jul 22 18:58:43 apollo kernel: eth0: Setting full-duplex based on MII #24 link partner capability of 45e1.
Jul 22 19:05:52 apollo syslogd 1.4.1: restart.
Dit bovenstaande heeft eigenlijk niets te maken met het feit dat de server de hele dag slecht bereikbaar was (en vorige week maandag ook), maar dit is ook niet echt goed. Vorige week had ik deze medlingen trouwens niet!
Hoe kan ik dit probleem aanpakken? Het vreemde is dus dat ik 2 keer ongeveer hetzelfde probleem heb op maandagochtend. Moet ik gewoon een nieuwe netwerkkaart proberen of kan het probleem ook elders liggen?