Rechenzentrum
Ein Rechenzentrum ist zunächst ein Gebäudeproblem: Fläche, Strom, Kühlung und Zugangsschutz bestimmen, wie viel Rechenleistung sich überhaupt unterbringen lässt. Die IT-Komponenten sind der Teil, der am häufigsten getauscht wird — die Infrastruktur darum herum hält Jahrzehnte.
Die mechanische Ordnung folgt dem 19-Zoll-Raster. Bauhöhen werden in Höheneinheiten gezählt, was Planung und Beschaffung standardisiert; die Bauform des Bladeservers verdichtet mehrere Rechner in einem gemeinsamen Gehäuse mit geteilter Strom- und Netzversorgung.
Bei der Stromversorgung verteilt die Power Distribution Unit im Schrank, die unterbrechungsfreie Stromversorgung überbrückt Ausfälle bis zum Anlaufen der Netzersatzanlage. Die Kühlung ist die eigentliche Begrenzung: Jedes Watt elektrischer Leistung wird zu Wärme, die wieder herausgeschafft werden muss. Kenngrößen wie die maximale Feuchtkugeltemperatur bestimmen, ob freie Kühlung möglich ist oder maschinell nachgeholfen werden muss.
Die Verfügbarkeit wird über Kennzahlen beschrieben, die man auseinanderhalten sollte: MTBF ist die mittlere Zeit zwischen Ausfällen, MTTR die mittlere Wiederherstellungszeit; erst beide zusammen ergeben eine Verfügbarkeit. Die Formulierung „five nines" steht für 99,999 Prozent und damit für rund fünf Minuten Ausfall im Jahr. Ein Single Point of Failure ist jede Komponente, deren Ausfall den Dienst beendet — sie zu finden ist die eigentliche Arbeit jeder Hochverfügbarkeitsplanung.
Für die interne Vernetzung kommen zudem Techniken mit besonders geringer Latenz zum Einsatz, etwa InfiniBand.
- Active Power Factor Correction (Active PFC) Active Power Factor Correction (Active PFC) bezeichnet die aktive Korrektur des Leistungsfaktors in Netzteilen, um ein optimales Verhältnis von Wirk- zu Scheinleistung zu erreichen.
- Bladeserver Bladeserver (Blade) sind eine Bauform von Serversystemen, bei der mehrere Serverblades in einem Gehäuse Netzteil, Tastatur und Maus teilen, um hohe Packungsdichten zu erreichen.
- British Thermal Unit (BTU) Das British Thermal Unit (BTU) ist eine Einheit für die Energie und wird in der Klimatechnik verwendet.
- Customer Replaceable Unit (CRU) Die Customer Replaceable Unit (CRU) bezeichnet austauschbare Gerätekomponenten, die vom Kunden ohne spezifische Ausbildung ersetzt werden können, wie etwa Hot-Plug-Festplatten.
- Dedicated Server Dedicated Server bezeichnet einen Server, der exklusiv für eine Aufgabe vorgesehen ist, etwa als dedizierter Fileserver, und wird von Providern als Root-Server zur eigenen Nutzung bereitgestellt.
- five nines Five nines bezeichnet umgangssprachlich eine Verfügbarkeit von 99,999 Prozent, was einer jährlichen Ausfallzeit von rund fünf Minuten entspricht.
- High Availability Cluster Multi-Processing (HACMP) High Availability Cluster Multi-Processing (HACMP) ist eine Clusterlösung der IBM zur Steigerung der Ausfallsicherheit durch redundante Server und Netzanbindung.
- Höheneinheit (HE) Die Höheneinheit definiert die Höhe von Einbauten in 19-Zoll-Schränken. Eine Höheneinheit entspricht 44,45 Millimetern oder 1 3/4 Zoll, in englischen Texten als 1U oder 1 Unit bezeichnet.
- Infiniband InfiniBand ist ein schneller, serieller Bus, der besonders verzögerungsarm arbeitet und Node-Kopplung für Cluster ermöglicht. Aktuell sind drei Varianten mit 2,5, 10 und 30 GBit/s spezifiziert.
- Load Balancing Load Balancing bezeichnet Verfahren zur Lastverteilung auf mehrere Systeme wie Server, Router oder Switches, realisiert durch Software wie spezielle DNS-Konfiguration oder Hardware Load Balancer.
- Maximum Wet Bulb Maximum Wet Bulb bezeichnet die Obergrenze der mit einem Feuchtthermometer oder Psychrometer gemessenen Temperatur unter Berücksichtigung der Luftfeuchte.
- Mean Time Between Failures (MTBF) Die Mean Time Between Failures (MTBF) bezeichnet die mittlere Zeitdauer zwischen zwei Fehlern eines Systems und dient zur Abschätzung der Zuverlässigkeit eines Gerätes.
- Mean Time To Repair (MTTR) Die Mean Time To Repair (MTTR) bezeichnet die mittlere Reparaturzeit eines Systems und dient als Kennzahl zur Bewertung der Systemzuverlässigkeit und -verfügbarkeit.
- Myrinet Myrinet ist ein Hochgeschwindigkeits-LAN zur Kopplung von Hochleistungsrechnern in Clustern, das einen sehr kleinen Protokoll-Overhead und geringe Latenz bietet; aktuelle Varianten sind Myrinet-2000 und Myri-10G mit bis zu 9,6 GBit/s TCP-Transferrate.
- Network Operations Center (NOC) Das Network Operations Center (NOC) ist die technische Betriebsstelle für ein Netzwerk und verantwortlich für dessen Überwachung, die von großen Internet Service Providern eigenständig betrieben wird.
- Power Distribution Unit (PDU) In Deutsch sagt man auch Steckdosenleiste dazu.
- Rack Ein Rack ist ein Gestell oder Schrank zum Einbau von Netzwerkkomponenten und Servern, dessen Einbaubreite normalerweise 19 Zoll beträgt.
- Reinraum Ein Reinraum hält die Kontamination der Luft unter bestimmten Grenzwerten und wird etwa für die Halbleiterproduktion benötigt.
- Service Level Agreement (SLA) Das Service Level Agreement (SLA) beschreibt vertraglich garantierte Leistungen wie Reaktionszeiten, Lieferzeiten oder Systemverfügbarkeit und muss unmissverständlich und messbar definiert werden.
- Single Point of Failure (SPoF) Ein Single Point of Failure (SPoF) ist eine Komponente, deren Ausfall das gesamte System lahmlegt, etwa ein einzelnes Netzteil in einem ansonsten redundanten Server.
- Total Cost of Ownership (TCO) Total Cost of Ownership (TCO) ist ein Berechnungsverfahren zur Bestimmung aller Kosten von Investitionsgütern, das in der IT Anschaffung, Betrieb, Wartung und Service umfasst.
- Uninterruptable Power Supply (UPS) Eine unterbrechungsfreie Stromversorgung (UPS, engl. Uninterruptable Power Supply) versorgt angeschlossene Geräte bei Netzausfällen oder Spannungsschwankungen kurzfristig mit Strom aus Pufferbatterien.