MapR FS - MapR FS
| Vývojáři | MapR |
|---|---|
| Celé jméno | MapR FS |
| Představený | 2011 s Linuxem |
| Struktury | |
| Obsah adresáře | B-strom |
| Přidělení souborů | Víceúrovňový B-strom |
| Limity | |
| Max. velikost svazku | neomezený |
| Max. velikost souboru | 16 EiB |
| Max. počet souborů | neomezený |
| Funkce | |
| Oprávnění systému souborů | Standardní výrazy Unix, řízení přístupu |
| Transparentní komprese | Ano |
| Transparentní šifrování | Ano |
| jiný | |
| Podporované operační systémy | Linux |
MapR File System ( MapR FS ) je clusterový souborový systém , který podporuje oba velmi rozsáhlé a vysoce výkonné použití. MapR FS podporuje řadu rozhraní, včetně konvenčního přístupu k souborům pro čtení / zápis přes NFS a rozhraní FUSE, stejně jako přes rozhraní HDFS používané mnoha systémy, jako jsou Apache Hadoop a Apache Spark . Kromě přístupu orientovaného na soubory podporuje MapR FS přístup k tabulkám a streamům zpráv pomocí API Apache HBase a Apache Kafka i prostřednictvím rozhraní databáze dokumentů.
MapR FS, který byl poprvé vydán v roce 2010, je nyní typicky popisován jako platforma MapR Converged Data Platform díky přidání tabulkových rozhraní a rozhraní pro zasílání zpráv. Ke implementaci všech těchto forem trvalého ukládání dat se však používá stejná základní technologie a všechna rozhraní jsou nakonec podporována stejnými procesy serveru. K rozlišení různých schopností celkové datové platformy se termín MapR FS používá konkrétněji k označení souborově orientovaných rozhraní, MapR DB nebo MapR JSON DB se používá k označení tabulkových rozhraní a MapR Streams se používá k popisu možnosti streamování zpráv.
MapR FS je klastrový souborový systém v tom, že poskytuje jednotný přístup ze / k souborům a dalším objektům, jako jsou tabulky, pomocí univerzálního jmenného prostoru přístupného z libovolného klienta systému. Řízení přístupu je také k dispozici pro soubory, tabulky a streamy používající výrazy řízení přístupu , které jsou rozšířením běžnějšího (a omezeného) seznamu řízení přístupu, který umožňuje skládat oprávnění nejen ze seznamů povolených uživatelů nebo skupin, ale místo toho povolit booleovské kombinace ID uživatele a skupin.
Dějiny
MapR FS byl vyvinut od roku 2009 společností MapR Technologies, aby rozšířil možnosti Apache Hadoop poskytnutím výkonnější a stabilnější platformy. Návrh MapR FS je ovlivněn různými dalšími systémy, jako je Andrew File System (AFS). Koncept objemů v AFS má určitou silnou podobnost z pohledu uživatelů, i když implementace v MapR FS je úplně jiná. Jedním z hlavních rozdílů mezi AFS a MapR FS je to, že druhý používá silný model konzistence, zatímco AFS poskytuje pouze slabou konzistenci.
Abychom splnili původní cíle podpory programů Hadoop, podporuje MapR FS rozhraní HDFS API překladem volání funkcí HDFS do interního rozhraní API na základě mechanismu vlastního vzdáleného volání procedur (RPC). Normální model HDFS pro jednorázový zápis je v MapR FS nahrazen plně měnitelným souborovým systémem, i když používáte HDFS API. Schopnost podporovat mutaci souborů umožňuje implementaci serveru NFS, který převádí operace NFS na interní volání MapR RPC. Podobné mechanismy se používají k povolení rozhraní souborového systému v uživatelském prostoru (FUSE) a přibližné emulaci rozhraní Apache HBase API.
Architektura
Soubory v MapR FS jsou interně implementovány rozdělením obsahu souboru na bloky , obvykle o velikosti 256 MB, i když velikost je pro každý soubor specifická. Každý blok je zapsán do kontejnerů, které jsou prvkem replikace v klastru. Kontejnery se replikují a replikace se provádí buď lineárním způsobem, kdy každá replika předává operace zápisu do další repliky v řadě, nebo hvězdným způsobem, kdy hlavní replika předává operace zápisu současně všem ostatním replikám. Jakmile jsou všechny zápisy do všech replik dokončeny, zápisy jsou potvrzeny hlavní replikou. Kontejnery interně implementují B-stromy, které se používají na více úrovních, například k mapování offsetu souboru na blok v souboru nebo k mapování offsetu souboru na správný blok 8kB v bloku.
Tyto B-stromy se také používají k implementaci adresářů. K nalezení podřízeného souboru nebo tabulky adresářů se používá dlouhý hash každého názvu souboru nebo adresáře v adresáři.
Svazek je speciální datová struktura podobná adresáři mnoha způsoby, kromě toho, že umožňuje další operace řízení přístupu a správy. Pozoruhodná schopnost svazků spočívá v tom, že uzly, na kterých se svazek může nacházet v klastru, lze omezit na řízení výkonu, zejména v silně napadených systémech s více nájemci, které provozují širokou škálu úloh.
V MapR FS se používá proprietární technologie k implementaci transakcí v kontejnerech a k dosažení konzistentní obnovy po havárii.
Mezi další funkce souborového systému patří
- Distribuovaná metadata klastru, včetně umístění všech kontejnerů a jejich uspořádání do řetězců replikace.
- Distribuovaná metadata včetně adresářového stromu. Všechny adresáře jsou plně replikovány a žádný jednotlivý uzel neobsahuje všechna metadata pro klastr.
- Efektivní využití B-stromů k dosažení vysokého výkonu i při velmi velkých adresářích.
- Tolerance oddílů. Klastr lze rozdělit na oddíly bez ztráty konzistence, i když může být ohrožena dostupnost. Replikace omezené konzistence napříč více klastry je také podporována pomocí zrcadlení svazků a téměř v reálném čase replikace tabulek a streamů.
- Konzistentní vícevláknová aktualizace. Soubory lze aktualizovat nebo číst pomocí velkého počtu podprocesů současně bez nutnosti globálních uzamykacích struktur.
- Postupné upgrady a online údržba souborového systému. Lze provádět téměř veškerou údržbu, včetně hlavních upgradů verzí, zatímco cluster nadále pracuje téměř plnou rychlostí.
Viz také
- GFS2
- Gluster
- Souborový systém Google
- Seznam souborových systémů
- Lesk (souborový systém)
- MooseFS
- OCFS2
- QFS
- RozoFS
- Systém souborů sdíleného disku
- ZFS