Allereerst excuses voor de lange lap, maar ik vermoed dat zonder uitleg, het niet echt veel zin heeft dit te posten 
Ik had gisteren, met mijn remote server (
) problemen met de netwerkkaart.
Nu de server na een reboot (network restart werkte niet) weer online is, ben ik uiteraard gelijk de /var/log/messages ingedoken.
Daar stond deze message:
Herhaaldelijk in.
(stuk of 7.000 keer ofzo)
Wat ik eruit haal, is dat de netwerkkaart een irc-conflict weet te krijgen (terwijl het systeem al 37 dagen draaide
) en dat daardoor de kernel niet echt meer data kan sturen (heeeeeel sloom was het, met pings van 30-60seconden op systemen in het zelfde lan)
Dit is al een keer eerder voorgekomen (ander systeem, zelfde fysieke plek)
En ik zie nu die "watchdog" regel erbij staan.
Heeft iemand ervaring hiermee, oid met instellen dat ie danwel een restart van de kaart probeert, danwel gewoon een reboot uitvoert, als de watchdog weer van dit soort problemen ziet?
- Relevante hardware:
p3's + serverworks mobo
onboard intel (Ethernet Pro 100) nic (gebruikt voor intern netwerk -> eth1)
extra 3com (3c905C-TX) nic (gebruikt voor extern netwerk, de probleem kaart dus, eth0)
- Software:
RedHat 7.1 custom install
(met zelf gecompileerde, apache, proftpd etc)
En een eigen 2.4.4 kernel.
(geen watchdog ingebouwd, trouwens, dus moet bij de default redhat install, of standaard in de kernel horen)
- Vragen dus:
* Weet iemand waardoor deze meldingen (de geheugendump-achtige dingen bedoel ik niet
) komen?
De kaart draaide tenslote 37 dagen zonder problemen.
* Weet iemand hoe het is op te lossen, of waar er eventueel een oplossing is te vinden?
* Weet iemand hoe ik die watchdog zou kunnen configureren, zodat ie het systeem restart (of iig de netwerkkaart re-init oid) als het weer voorkomt?
[edit vergeten interupts te posten :)]
Dat is dus na de reboot, maar er zijn dus ruim voldoende irq's beschikbaar...
Ik had gisteren, met mijn remote server (
Nu de server na een reboot (network restart werkte niet) weer online is, ben ik uiteraard gelijk de /var/log/messages ingedoken.
Daar stond deze message:
code:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
| Jun 18 00:35:28 vulcanus kernel: NETDEV WATCHDOG: eth0: transmit timed out Jun 18 00:35:28 vulcanus kernel: eth0: transmit timed out, tx_status 00 status e601. Jun 18 00:35:28 vulcanus kernel: diagnostics: net 0cfa media 8880 dma 0000003a. Jun 18 00:35:28 vulcanus kernel: eth0: Interrupt posted but not delivered -- IRQ blocked by another device? Jun 18 00:35:28 vulcanus kernel: Flags; bus-master 1, dirty 768(0) current 768(0) Jun 18 00:35:28 vulcanus kernel: Transmit list 00000000 vs. dff9b200. Jun 18 00:35:28 vulcanus kernel: 0: @dff9b200 length 8000002a status 0001002a Jun 18 00:35:28 vulcanus kernel: 1: @dff9b240 length 8000004a status 0001004a Jun 18 00:35:28 vulcanus kernel: 2: @dff9b280 length 80000036 status 00010036 Jun 18 00:35:28 vulcanus kernel: 3: @dff9b2c0 length 80000036 status 00010036 Jun 18 00:35:28 vulcanus kernel: 4: @dff9b300 length 80000036 status 00010036 Jun 18 00:35:28 vulcanus kernel: 5: @dff9b340 length 8000045d status 0001045d Jun 18 00:35:28 vulcanus kernel: 6: @dff9b380 length 8000045d status 0001045d Jun 18 00:35:28 vulcanus kernel: 7: @dff9b3c0 length 80000030 status 00010030 Jun 18 00:35:28 vulcanus kernel: 8: @dff9b400 length 80000030 status 00010030 Jun 18 00:35:28 vulcanus kernel: 9: @dff9b440 length 80000087 status 00010087 Jun 18 00:35:28 vulcanus kernel: 10: @dff9b480 length 8000008a status 0001008a Jun 18 00:35:28 vulcanus kernel: 11: @dff9b4c0 length 8000004a status 0001004a Jun 18 00:35:28 vulcanus kernel: 12: @dff9b500 length 8000003a status 0001003a Jun 18 00:35:28 vulcanus kernel: 13: @dff9b540 length 8000003a status 0001003a Jun 18 00:35:28 vulcanus kernel: 14: @dff9b580 length 8000003a status 8001003a Jun 18 00:35:28 vulcanus kernel: 15: @dff9b5c0 length 8000003a status 8001003a |
Herhaaldelijk in.
(stuk of 7.000 keer ofzo)
Wat ik eruit haal, is dat de netwerkkaart een irc-conflict weet te krijgen (terwijl het systeem al 37 dagen draaide
Dit is al een keer eerder voorgekomen (ander systeem, zelfde fysieke plek)
En ik zie nu die "watchdog" regel erbij staan.
Heeft iemand ervaring hiermee, oid met instellen dat ie danwel een restart van de kaart probeert, danwel gewoon een reboot uitvoert, als de watchdog weer van dit soort problemen ziet?
- Relevante hardware:
p3's + serverworks mobo
onboard intel (Ethernet Pro 100) nic (gebruikt voor intern netwerk -> eth1)
extra 3com (3c905C-TX) nic (gebruikt voor extern netwerk, de probleem kaart dus, eth0)
- Software:
RedHat 7.1 custom install
(met zelf gecompileerde, apache, proftpd etc)
En een eigen 2.4.4 kernel.
(geen watchdog ingebouwd, trouwens, dus moet bij de default redhat install, of standaard in de kernel horen)
- Vragen dus:
* Weet iemand waardoor deze meldingen (de geheugendump-achtige dingen bedoel ik niet
De kaart draaide tenslote 37 dagen zonder problemen.
* Weet iemand hoe het is op te lossen, of waar er eventueel een oplossing is te vinden?
* Weet iemand hoe ik die watchdog zou kunnen configureren, zodat ie het systeem restart (of iig de netwerkkaart re-init oid) als het weer voorkomt?
[edit vergeten interupts te posten :)]
code:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
| [acm@vulcanus /proc]$ cat interrupts
CPU0 CPU1
0: 1375213 1371665 IO-APIC-edge timer
1: 1 1 IO-APIC-edge keyboard
2: 0 0 XT-PIC cascade
8: 1 0 IO-APIC-edge rtc
14: 34218 37054 IO-APIC-edge ide0
16: 2794939 2808989 IO-APIC-level eth0
23: 42990 43049 IO-APIC-level eth1
28: 14 16 IO-APIC-level sym53c8xx
29: 12023 12479 IO-APIC-level sym53c8xx
NMI: 0 0
LOC: 2746581 2746635
ERR: 0 |
Dat is dus na de reboot, maar er zijn dus ruim voldoende irq's beschikbaar...