Toon posts:

Exchange cluster gescrashed

Pagina: 1
Acties:

Verwijderd

Topicstarter
We zitten hier met een heel groot probleem, ons exchange cluster is namelijk gecrashed. We hebben gelukkig wel een backup van de exchange data! De configuratie ziet (zag) 8)7 er als volgt uit:

Het is een windows 2000 adv server failover cluster met 2 nodes en een gedeeld schijvencabinet. Elke node heeft voor zichzelf een raid array waarop win2k adv server, win2k clusterservice en exchange in cluster mode is geinstalleerd. Het gedeelte schijvencabinet bevat 2 logical dives (èèn raid 5 en èèn mirror) waarop de exchange data zich bevind. Dit zijn shared disks. De actieve node heeft de schijven dus aan zich hangen. Alle hardware is IBM hardware.

Wat is gebeurd?
Wat er precies is gebeurt weten we eigenlijk niet, maar wegens capaciteits problemen was een uitbreiding van de schijvencapaciteit vereist. 4 schijven zijn daarom toegevoegd aan het schijvencabinet en toegevoegd aan een array. Dit leverde helaas niet het gehoopte resultaat op. Omdat het basic diks waren werd de unallocated extra space die we zouden moeten krijgen niet volledig weergegeven. Echter, bij het fysiek weer verwijderen van de schijven is het fout gegaan. Nadat de eerste (nieuwe) schijf weer uit het cabinet werd gehaald, ging het cluster onderuit. In de serverraid software was te zien dat het betreffende array offline was gezet op beide schijven. Vanaf dit moment werkte de overname van de schijven niet meer. De schijven worden niet meer door de failende node vrijgegeven waardoor deze door beide nodes worden aangesproken en de schijven op defunct worden gegooid.

Wat hebben we geprobeerd:
- we hebben de arrays en de logical drives voor de schijven in het extern schijvencabinet opnieuw aangemaakt, de cluster procedure hiervoor op de 2 nodes opnieuw gevolgd en de data restored. Helaas wou de clusterservice software niet meer starten
- we hebben de cluster software gedeïnstalleerd en weer opnieuw geïnstalleerd, met als gevolg dat we intussen weer een cluster hebben met 1 node. De andere node krijgen we echter niet meer aan het cluster toegevoegd. De instellingen voor clustering staan gewoon goed, maar hij eindigt met netwok path not found. (DNS, IP ed zijn geconfigureerd en getest)
- We hebben besloten om in ieder geval exchange morgen in de lucht proberen te brengen op de node die nu actief is. Daarvoor zijn we nu een restore van de data aan het doen. Mocht dit lukken dan hebben we in ieder geval weer exchange en kan er weer gewerkt worden.

Mijn vraag
Heeft iemand nog suggesties aan de hand van dit verhaal. Exchange van voor af aan installeren en dan data restoren is niet zo eenvoudig omdat je in cluster mode geen desaster recovery installatie kan doen. Iemand een idee waarom het cluster niet meer zou kunnen werken? Alle tips zijn welkom. Het lijkt me dat als we het cluster eenmaal hebben lopen dat we exchange wel weer aan de praat krijgen..

  • midget
  • Registratie: Maart 2001
  • Laatst online: 10-07 11:00
Probeer eens van Node_A Node_B te pingen en een loop te geven ping (NODE_A) -t.
Daarna Node_B configureren hij vind nou wel het netwerk pad.
Suces ermee is het een hardware matige of een software matige cluster?

Verwijderd

Topicstarter
midget schreef op 14 February 2003 @ 20:59:
Probeer eens van Node_A Node_B te pingen en een loop te geven ping (NODE_A) -t.
Daarna Node_B configureren hij vind nou wel het netwerk pad.
Suces ermee is het een hardware matige of een software matige cluster?
We zijn er maar ff mee gestopt voor vandaag en gaan morgen weer verder, ik ga het morgenvroeg meteen uitproberen nog voordat we exchange op alleen de werkende node proberen te starten.

  • ralfbosz
  • Registratie: December 2000
  • Laatst online: 08-09 11:57

ralfbosz

xm create bosz -c

Wat zijn dat nou voor systeembeheerders? Schandalig naar huis gaan terwijl het probleem nog niet is opgelost, gewoon de hele avond door gaan }).
Modbreak:

Onzin posten doe je maar ergens anders. Dit is niet de HK :*

[ Voor 35% gewijzigd door F_J_K op 14-02-2003 21:56 ]

rm -r *


Verwijderd

Topicstarter
dat hebben we afgelopen nacht al gedaan.... iedere keer restoren en rebuilden....aargghh frustrerend dat wachten

  • squaddie
  • Registratie: Februari 2000
  • Laatst online: 08-09 20:28
Het is voor mij een tijd geleden dat ik met Exchange heb gewerkt, dus daar kan ik geen antwoord op geven. Echter heb enige kennis/ervaring met cluster en raid.

Maar een aantal dingen zijn uit je verhaal niet duidelijk.
1. Waarom zijn er twee logical drives op het cluster?
2. Hoe heb je de nieuwe schijven aan de RAID5? array toegevoegd?
3. Waarom viel de nieuwe ruimte tegen? (maximale ruimte die gebruikt gaat worden is gelijk aan de kleinste schijf in de array)
Omdat het basic diks waren werd de unallocated extra space die we zouden moeten krijgen niet volledig weergegeven.
Ik snap niet helemaal wat je met deze zin bedoelt.

[IMHO] Het erop lijkt dat het array nog niet klaar was met rebuilden van de nieuwe array toen de schijven uit het cabinet gehaald werden. Een RAID5-array kan er niet tegen als meer dan een schijf tegelijk uitvalt, het voor de RAID-controller dan onmogelijk de verloren data opnieuw op te bouwen en resulteert in het verloren gaan van de array. Om dit risico te verkleinen worden hotspares in het cabinet gebruikt.

Het probleem voor het niet starten van de clustersoftware heeft waarschijnlijk te maken met het verloren gaan met het orginele array. Het aanmaken van een ander array maakt voor de cluster-software/RAID-controller niet uit, dit wordt gezien als een nieuw array! Ik denk dat het herinstalleren geen positieve invloed op het probleem gehad heeft.

Ik gok dat als je in het managmentprogramma van de clustersoftware het oude array weg gegooid had en de nieuwe erin gezet dat de software wel weer wilde starten. Zelf heb ik dit nog nooit getest met het cluster wat hier staat, overigens draait daar geen w2k op maar NT4 Enterprise edition.[/IMHO]

@Midget: Dit is een hardwarematig cluster bestaande uit twee servers beide met een eigen SCSI-kabel verbonden aan een eigen RAID-controller in het diskcabinet.

There are never enough hours in a day, but always too many days before saturday.


Verwijderd

Topicstarter
Squaddie een aantal antwoorden op je vragen:
1 Er zijn meerdere logical drives op het cluster omdat er een logical drive is voor mailstores (5 stuks) en een logical volume voor de public folders ed.
2 Ik denk idd dat het hier is fout gegaan. De nieuwe schijven zijn in het extern cabinet geduwt, waarna ze via de raid server manager aan beide logical volumes zijn toegevoegd. Dus 2 aan de raid 5 lv en 2 aan de gemirrorde lv. We hebben op dat moment geen rekening gehouden met de niet actieve node.
3 Dit leverde echter maar 9 gig unallocated space op in het raid 5 logical volume. In dit logical volume zaten op dat moment 6 36 gig schijven. (dus 2x 36 gig extra). De 9 gig kan ik zo snel even niet verklaren.

We gingen er in eerste instantie vanuit dat het probleem zich voordeed doordat er basic disks gebruikt werden en geen dynamic. Omdat je in dit cluster geen dynamic diks mag gebruiken.

Ik ga nu weer naar mijn werk, en ga weer aan de slag, zal regelmatig hier ff komen kijken

  • squaddie
  • Registratie: Februari 2000
  • Laatst online: 08-09 20:28
1. Ok duidelijk.
2. Op zich zou dit geen problemen horen te veroorzaken, zo'n extern cluster wordt door het OS in dit geval gezien als twee schijven en kan het geen bal schelen hoe dat precies is geconfigureerd. De arrays hebben op zich niets te maken met basic of dynamic schijfindelingen, die schijven worden opnieuw ingedeeld door de controller.
3. Weet je zeker dat de arrays klaar waren met rebuilden??? Ik heb er anders geen verklaring voor waarom die extra ruimte niet vrijgekomen is.

There are never enough hours in a day, but always too many days before saturday.


Verwijderd

Topicstarter
Het cluster is op dit moment het probleem niet meer, we zitten nu te stoeien met exchange. We proberen de oorspronkelijke aan de gang te krijgen, maar we stuiten steeds op nieuwe problemen. Ik ben tegelijkertijd begonnen met het inrichten van een nieuwe exchange server. De storage groups heb ik daar al gerestored met behulp van tsm voor exchange. Nu moeten alleen de gebruikers hun postvak instellingen naar de nieuwe exchange laten wijzen. Weet iemand of hier een 'bulk'methode voor is of dat elke gebruiker dat handmatig moet gaan doen? We moeten immmers ook ooit weer terug naar het cluster, en dat zou betekenen dat de gebruikers weer deze handeling moeten uitvoeren. Het gaat om zo'n 800 gebruikers

[ Voor 15% gewijzigd door Verwijderd op 16-02-2003 10:21 ]


Verwijderd

Topicstarter
oke exchange draait weer, al is het dan niet meer op een cluster, maar dat komt wel weer. Alle mailboxes hebben we kunnen reconnecten naar de nieuwe exchange en alle data is gerestored. Alleen het laatste probleempje is dat er nog zo ongeveer 500 mails in de qeue staan van de oude exchange (die overigens wel nog in de lucht is, maar niet fatsoenlijk). Hoe krijg ik die mail naar de nieuwe exchange??? Dus van de queue van de exchange-1 naar de exchange-2...

  • mutsje
  • Registratie: September 2000
  • Laatst online: 07-09 15:10

mutsje

Certified Prutser

Bij mijn weten is het niet mogelijk om mail dat in een queue staat naar een niet meer bestaande mailserver(of niet meer functionerende mailserver) te redirecten naar een werkende mailserver. Ik denk dat je die 500 mail moet deleten. Hadden jullie technet hier al naar afgestroopt.
Pagina: 1