We zitten hier met een heel groot probleem, ons exchange cluster is namelijk gecrashed. We hebben gelukkig wel een backup van de exchange data! De configuratie ziet (zag)
er als volgt uit:
Het is een windows 2000 adv server failover cluster met 2 nodes en een gedeeld schijvencabinet. Elke node heeft voor zichzelf een raid array waarop win2k adv server, win2k clusterservice en exchange in cluster mode is geinstalleerd. Het gedeelte schijvencabinet bevat 2 logical dives (èèn raid 5 en èèn mirror) waarop de exchange data zich bevind. Dit zijn shared disks. De actieve node heeft de schijven dus aan zich hangen. Alle hardware is IBM hardware.
Wat is gebeurd?
Wat er precies is gebeurt weten we eigenlijk niet, maar wegens capaciteits problemen was een uitbreiding van de schijvencapaciteit vereist. 4 schijven zijn daarom toegevoegd aan het schijvencabinet en toegevoegd aan een array. Dit leverde helaas niet het gehoopte resultaat op. Omdat het basic diks waren werd de unallocated extra space die we zouden moeten krijgen niet volledig weergegeven. Echter, bij het fysiek weer verwijderen van de schijven is het fout gegaan. Nadat de eerste (nieuwe) schijf weer uit het cabinet werd gehaald, ging het cluster onderuit. In de serverraid software was te zien dat het betreffende array offline was gezet op beide schijven. Vanaf dit moment werkte de overname van de schijven niet meer. De schijven worden niet meer door de failende node vrijgegeven waardoor deze door beide nodes worden aangesproken en de schijven op defunct worden gegooid.
Wat hebben we geprobeerd:
- we hebben de arrays en de logical drives voor de schijven in het extern schijvencabinet opnieuw aangemaakt, de cluster procedure hiervoor op de 2 nodes opnieuw gevolgd en de data restored. Helaas wou de clusterservice software niet meer starten
- we hebben de cluster software gedeïnstalleerd en weer opnieuw geïnstalleerd, met als gevolg dat we intussen weer een cluster hebben met 1 node. De andere node krijgen we echter niet meer aan het cluster toegevoegd. De instellingen voor clustering staan gewoon goed, maar hij eindigt met netwok path not found. (DNS, IP ed zijn geconfigureerd en getest)
- We hebben besloten om in ieder geval exchange morgen in de lucht proberen te brengen op de node die nu actief is. Daarvoor zijn we nu een restore van de data aan het doen. Mocht dit lukken dan hebben we in ieder geval weer exchange en kan er weer gewerkt worden.
Mijn vraag
Heeft iemand nog suggesties aan de hand van dit verhaal. Exchange van voor af aan installeren en dan data restoren is niet zo eenvoudig omdat je in cluster mode geen desaster recovery installatie kan doen. Iemand een idee waarom het cluster niet meer zou kunnen werken? Alle tips zijn welkom. Het lijkt me dat als we het cluster eenmaal hebben lopen dat we exchange wel weer aan de praat krijgen..
Het is een windows 2000 adv server failover cluster met 2 nodes en een gedeeld schijvencabinet. Elke node heeft voor zichzelf een raid array waarop win2k adv server, win2k clusterservice en exchange in cluster mode is geinstalleerd. Het gedeelte schijvencabinet bevat 2 logical dives (èèn raid 5 en èèn mirror) waarop de exchange data zich bevind. Dit zijn shared disks. De actieve node heeft de schijven dus aan zich hangen. Alle hardware is IBM hardware.
Wat is gebeurd?
Wat er precies is gebeurt weten we eigenlijk niet, maar wegens capaciteits problemen was een uitbreiding van de schijvencapaciteit vereist. 4 schijven zijn daarom toegevoegd aan het schijvencabinet en toegevoegd aan een array. Dit leverde helaas niet het gehoopte resultaat op. Omdat het basic diks waren werd de unallocated extra space die we zouden moeten krijgen niet volledig weergegeven. Echter, bij het fysiek weer verwijderen van de schijven is het fout gegaan. Nadat de eerste (nieuwe) schijf weer uit het cabinet werd gehaald, ging het cluster onderuit. In de serverraid software was te zien dat het betreffende array offline was gezet op beide schijven. Vanaf dit moment werkte de overname van de schijven niet meer. De schijven worden niet meer door de failende node vrijgegeven waardoor deze door beide nodes worden aangesproken en de schijven op defunct worden gegooid.
Wat hebben we geprobeerd:
- we hebben de arrays en de logical drives voor de schijven in het extern schijvencabinet opnieuw aangemaakt, de cluster procedure hiervoor op de 2 nodes opnieuw gevolgd en de data restored. Helaas wou de clusterservice software niet meer starten
- we hebben de cluster software gedeïnstalleerd en weer opnieuw geïnstalleerd, met als gevolg dat we intussen weer een cluster hebben met 1 node. De andere node krijgen we echter niet meer aan het cluster toegevoegd. De instellingen voor clustering staan gewoon goed, maar hij eindigt met netwok path not found. (DNS, IP ed zijn geconfigureerd en getest)
- We hebben besloten om in ieder geval exchange morgen in de lucht proberen te brengen op de node die nu actief is. Daarvoor zijn we nu een restore van de data aan het doen. Mocht dit lukken dan hebben we in ieder geval weer exchange en kan er weer gewerkt worden.
Mijn vraag
Heeft iemand nog suggesties aan de hand van dit verhaal. Exchange van voor af aan installeren en dan data restoren is niet zo eenvoudig omdat je in cluster mode geen desaster recovery installatie kan doen. Iemand een idee waarom het cluster niet meer zou kunnen werken? Alle tips zijn welkom. Het lijkt me dat als we het cluster eenmaal hebben lopen dat we exchange wel weer aan de praat krijgen..