Síťová databáze biomolekulárních objektů - Biomolecular Object Network Databank
Biomolekul objektů sítě databanka se o bioinformatiky databank obsahující informace o malých molekul struktur a interakcí. Databanka integruje řadu existujících databází, aby poskytla komplexní přehled o informacích aktuálně dostupných pro danou molekulu.
Pozadí
| Vývojáři | Christopher Hogue a kol., Výzkumný ústav Samuela Lunenfelda, Mount Sinai. Obchodní práva: Unleashed Informatics |
|---|---|
| Stabilní uvolnění | BIND 4.0, SMIDsuite
|
| Typ | Bioinformatický nástroj |
| Licence | Otevřený přístup |
| webová stránka | [1] |
Iniciativa Blueprint začala jako výzkumný program v laboratoři Dr. Christophera Hogue ve Výzkumném ústavu Samuela Lunenfelda v nemocnici Mount Sinai v Torontu . 14. prosince 2005 společnost Unleashed Informatics Limited získala obchodní práva na duševní vlastnictví iniciativy Blueprint Initiative . To zahrnovalo práva na databázi interakce proteinů BIND, databázi interakcí malých molekul SMID a datový sklad SeqHound. Unleashed Informatics je poskytovatel služeb správy dat a dohlíží na správu a přípravu iniciativy Blueprint pod vedením Dr. Hogue.
Konstrukce
BOND integruje původní databáze Blueprint Initiative i další databáze, jako je Genbank , v kombinaci s mnoha nástroji potřebnými k analýze těchto dat. K dispozici jsou také anotační odkazy na sekvence, včetně identifikátorů taxonů, nadbytečných sekvencí, popisů genové ontologie , identifikátorů Mendelovy dědičnosti online v člověku , konzervovaných domén , křížových odkazů na databáze, identifikátorů LocusLink a úplných genomů. BOND usnadňuje dotazy mezi databázemi a je prostředkem otevřeného přístupu, který integruje data interakce a sekvence.
Databáze interakcí malých molekul (SMID)
Malá molekula interakce databáze je databáze obsahující doménu malá molekula proteinových interakcí. Využívá přístup založený na doménách k identifikaci rodin domén, které se nacházejí v databázi Conserved Domain Database (CDD), které interagují s dotazovanou malou molekulou. CDD od NCBI sloučí data z několika různých zdrojů; Protein FAMilies (PFAM), Simple Modular Architecture Research Tool (SMART), Cluster of Orthologous Genes (COGs), and NCBI's own curated websites. Data v SMID jsou odvozena z Protein Data Bank (PDB), databáze známých struktur proteinových krystalů. SMID lze dotazovat zadáním GI proteinu, identifikátoru domény, PDB ID nebo SMID ID. Výsledky hledání poskytují informace o malé molekule, proteinu a doméně pro každou interakci identifikovanou v databázi. Interakce s nebiologickými kontakty jsou ve výchozím nastavení standardně vyřazeny.
SMID-BLAST je nástroj vyvinutý k anotaci známých vazebných míst s malou molekulou a k predikci vazebných míst v proteinech, jejichž krystalová struktura dosud nebyla stanovena. Predikce je založena na extrapolaci známých interakcí nalezených v PDB na interakce mezi nekrystalizovaným proteinem s malou zájmovou molekulou. SMID-BLAST byl ověřen proti testovací sadě známých interakcí s malými molekulami z PDB. Ukázalo se, že je to přesný prediktor interakcí protein-malá molekula; 60% předpovězených interakcí se shodovalo s PDB anotovaným vazebným místem a z těchto 73% mělo více než 80% správně identifikovaných vazebných zbytků proteinu. Hogue, C a kol. Odhaduje se, že 45% předpovědí, které nebyly pozorovány v datech PDB, ve skutečnosti představuje skutečná pozitiva.
Síťová databáze biomolekulárních interakcí (BIND)
Úvod
Myšlenku databáze dokumentující všechny známé molekulární interakce původně navrhl Tony Pawson v 90. letech a později ji vyvinuli vědci z University of Toronto ve spolupráci s University of British Columbia . Rozvoj síťové databáze biomolekulárních interakcí (BIND) byl podpořen granty od Kanadských institutů pro výzkum zdraví ( CIHR ), Genome Canada, Kanadské nadace pro inovace a Ontario Research and Development Fund. BIND byl původně navržen jako neustále rostoucí depozitář informací týkajících se biomolekulárních interakcí, molekulárních komplexů a cest. Jelikož proteomika je rychle se rozvíjející obor, je třeba, aby vědci měli snadno k dispozici informace z vědeckých časopisů. BIND usnadňuje pochopení molekulárních interakcí a cest zapojených do buněčných procesů a nakonec poskytne vědcům lepší pochopení vývojových procesů a patogeneze onemocnění
Hlavní cíle projektu BIND jsou: vytvořit veřejný proteomický zdroj, který je k dispozici všem; vytvořit platformu umožňující datamining z jiných zdrojů (PreBIND); vytvořit platformu schopnou prezentovat vizualizace složitých molekulárních interakcí. Od začátku je BIND otevřeným přístupem a software lze volně distribuovat a upravovat. V současné době BIND obsahuje specifikaci dat, databázi a související nástroje pro dolování a vizualizaci dat. Nakonec se doufá, že BIND bude souborem všech interakcí vyskytujících se v každém z hlavních modelových organismů.
Struktura databáze
BIND obsahuje informace o třech typech dat: interakcích, molekulárních komplexech a drahách.
- Interakce jsou základní součástí BIND a popisují, jak 2 nebo více objektů (A a B) interagují navzájem. Objekty mohou být různé: DNA , RNA , geny , proteiny , ligandy nebo fotony . Interakční záznam obsahuje nejvíce informací o molekule; poskytuje informace o svém názvu a synonymech, kde se nachází (např. kde v buňce, jaký druh, kdy je aktivní atd.) a jeho sekvenci nebo kde lze její sekvenci najít. Interakční vstup také nastiňuje experimentální podmínky potřebné k pozorování vazby in vitro, chemické dynamiky (včetně termodynamiky a kinetiky ).
- Druhým typem položek BIND jsou molekulární komplexy. Molekulární komplexy jsou definovány jako agregát molekul, které jsou stabilní a mají funkci, když jsou navzájem vázány. Záznam může také obsahovat některé informace o roli komplexu v různých interakcích a data vstupu molekulárního komplexu spojují data ze 2 nebo více záznamů interakcí.
- Třetí složkou BIND je sekce záznamu cesty. Dráha se skládá ze sítě interakcí, které se podílejí na regulaci buněčných procesů. Tato část může také obsahovat informace o fenotypech a onemocněních souvisejících s cestou.
Minimální množství informací potřebných k vytvoření záznamu v BIND je publikační odkaz PubMed a záznam v jiné databázi (např. GenBank ). Každá položka v databázi poskytuje reference / autory dat. Jelikož BIND je neustále rostoucí databáze, všechny komponenty BIND sledují aktualizace a změny.
BIND je založen na specifikaci dat napsané pomocí jazyka Abstract Syntax Notation 1 ( ASN.1 ). ASN.1 používá také NCBI při ukládání dat pro svůj systém Entrez a proto BIND používá pro reprezentaci dat stejné standardy jako NCBI. Jazyk ASN.1 je upřednostňován, protože jej lze snadno přeložit do jiných jazyků specifikací dat (např. XML ), snadno zvládne složitá data a lze jej použít na všechny biologické interakce - nejen na proteiny. Bader a Hogue (2000) připravili podrobný rukopis specifikace dat ASN.1, kterou používá BIND.
Zadávání a kurátorství údajů
Doporučuje se odesílání uživatelů do databáze. Chcete-li přispět do databáze, musíte zadat: kontaktní informace, identifikátor PubMed a dvě molekuly, které interagují. Osoba, která odešle záznam, je jeho vlastníkem. Všechny záznamy jsou před zveřejněním ověřeny a BIND je vybrán pro zajištění kvality. Kurz BIND má dvě stopy: vysokou propustnost (HTP) a nízkou propustnost (LTP). Záznamy HTP pocházejí z článků, které uvádějí více než 40 výsledků interakce z jedné experimentální metodiky. Kurátoři HTP mají obvykle bioinformatické zázemí. Kurátoři HTP jsou zodpovědní za shromažďování úložiště experimentálních dat a také vytvářejí skripty pro aktualizaci BIND na základě nových publikací. Záznamy LTP jsou sestavovány jednotlivci s MSc nebo PhD a laboratorními zkušenostmi s interakčním výzkumem. Kurátoři LTP dostávají další školení prostřednictvím kanadských workshopů o bioinformatice . Informace o chemii malých molekul ošetřují chemici samostatně, aby zajistili, že kurátor bude mít o daném tématu dostatečné znalosti. Prioritou kurátorství BIND je zaměřit se na LTP ke shromažďování informací při jejich publikování. Ačkoli studie HTP poskytují více informací najednou, je hlášeno více studií LTP a podobné počty interakcí jsou hlášeny oběma stopami. V roce 2004 BIND shromáždil údaje ze 110 časopisů.
Růst databáze
BIND od svého pojetí významně vzrostl; ve skutečnosti databáze zaznamenala v letech 2003 až 2004 desetinásobný nárůst záznamů. Do září 2004 bylo do roku 2004 více než 100 000 záznamů o interakcích (včetně 58 266 protein-protein, 4 225 geneticky, 874 proteinů s malou molekulou, 25 857 proteinů-DNA, a 19 348 interakcí biopolymerů). Databáze také obsahuje sekvenční informace pro 31 972 proteinů, 4560 vzorků DNA a 759 vzorků RNA. Tyto příspěvky byly shromážděny z 11 649 publikací; proto databáze představuje důležité sloučení dat. Mezi organismy se záznamy v databázi patří: Saccharomyces cerevisiae , Drosophila melanogaster , Homo sapiens , Mus musculus , Caenorhabditis elegans , Helicobacter pylori , Bos taurus , HIV-1 , Gallus gallus , Arabidopsis thaliana a další. Do září 2004 bylo zahrnuto celkem 901 taxonů a BIND byl rozdělen na BIND-Metazoa, BIND-Houby a BIND-Taxroot.
Nejen, že jsou informace obsažené v databázi neustále aktualizovány, samotný software prošel několika revizemi. Verze 1.0 BIND byla vydána v roce 1999 a na základě zpětné vazby od uživatelů byla upravena tak, aby zahrnovala další podrobnosti o experimentálních podmínkách vyžadovaných pro vazbu a hierarchický popis buněčného umístění interakce. Verze 2.0 byla vydána v roce 2001 a obsahovala možnost propojení s informacemi dostupnými v jiných databázích. Verze 3.0 (2002) rozšířila databázi fyzikálních / biochemických interakcí také o genetické interakce. Verze 3.5 (2004) obsahovala vylepšené uživatelské rozhraní, jehož cílem bylo zjednodušit vyhledávání informací. V roce 2006 byl program BIND začleněn do databáze biomolekulárních objektových sítí (BOND), kde je i nadále aktualizován a vylepšován.
Speciální funkce
BIND byla první databází svého druhu, která obsahovala informace o biomolekulárních interakcích, reakcích a drahách v jednom schématu. Je také první, kdo založil svoji ontologii na chemii, která umožňuje 3D reprezentaci molekulárních interakcí. Základní chemie umožňuje popsat molekulární interakce až na atomovou úroveň rozlišení.
PŘIPOJTE přidružený systém pro dolování dat k vyhledání informací o biomolekulární interakci ve vědecké literatuře. Lze zadat název nebo přístupové číslo proteinu a PreBIND prohledá literaturu a vrátí seznam potenciálně interagujících proteinů. BIND BLAST je také k dispozici k vyhledání interakcí s proteiny, které jsou podobné těm, které jsou uvedeny v dotazu.
BIND nabízí několik „funkcí“, které mnoho dalších proteomických databází neobsahuje. Autoři tohoto programu vytvořili rozšíření tradiční nomenklatury IUPAC, aby pomohli popsat posttranslační modifikace , ke kterým dochází u aminokyselin. Tyto modifikace zahrnují: acetylaci , formylaci , methylaci , palmitoylaci atd. Rozšíření tradičních kódů IUPAC umožňuje, aby tyto aminokyseliny byly také zastoupeny v sekvenční formě. BIND také využívá jedinečný vizualizační nástroj známý jako OntoGlyphs . OntoGlyphs byly vyvinuty na základě Gene Ontology (GO) a poskytují odkaz zpět na původní informace GO. Řada pojmů GO byla seskupena do kategorií, z nichž každý představuje konkrétní funkci, specifičnost vazby nebo lokalizaci v buňce. Celkem existuje 83 znaků OntoGlyph. Existuje 34 funkčních OntoGlyphů, které obsahují informace o roli molekuly (např. Fyziologie buněk, transport iontů, signalizace). Existuje 25 vazebných OntoGlyphů, které popisují, na co se molekula váže (např. Ligandy, DNA, ionty). Dalších 24 OntoGlyphů poskytuje informace o umístění molekuly v buňce (např. Jádro, cytoskelet). Tyto OntoGlyphs lze vybrat a manipulovat tak, aby zahrnovaly nebo vylučovaly určité vlastnosti z výsledků vyhledávání. Vizuální povaha OntoGlyphů také usnadňuje rozpoznávání vzorů při prohlížení výsledků vyhledávání. ProteoGlyfy jsou grafická znázornění strukturních a vazebných vlastností proteinů na úrovni konzervovaných domén. Protein je zobrazen jako přímá vodorovná čára a jsou vloženy glyfy, které představují konzervované domény. Každý glyf je zobrazen tak, aby představoval relativní polohu a délku jeho zarovnání v proteinové sekvenci.
Přístup do databáze
Uživatelské rozhraní databáze je webové a lze jej dotazovat pomocí textových nebo přístupových čísel / identifikátorů. Od jeho integrace s ostatními složkami BOND byly ve výsledcích přidány sekvence do interakcí, molekulárních komplexů a drah. Záznamy obsahují informace o: BIND ID, popisu interakce / komplexu / cesty, publikacích, aktualizačních záznamech, organismu, OntoGlyphs, ProteoGlyphs a odkazech na další databáze, kde lze najít další informace. Záznamy BIND zahrnují různé formáty prohlížení (např. HTML , ASN.1 , XML , FASTA ), různé formáty pro export výsledků (např. ASN.1, XML , seznam GI , PDF ) a vizualizace (např. Cytoscape ). Přesné možnosti prohlížení a exportu se liší v závislosti na tom, jaký typ dat byl načten.
Statistiky uživatelů
Počet Unleashed Registrantů se od integrace BIND zvýšil 10krát. V prosinci 2006 registrace nedosáhla 10 000. Předplatitelé komerčních verzí BOND spadají do šesti obecných kategorií; zemědělství a potravinářství , biotechnologie , farmacie , informatika , materiály a další. Biotechnologický sektor je největší z těchto skupin a má 28% předplatného. Následují farmaceutika a informatika s 22% a 18%. Spojené státy drží většinu těchto odběrů, 69%. Mezi další země s přístupem ke komerční verzi BOND patří Kanada , Spojené království , Japonsko , Čína , Korea , Německo , Francie , Indie a Austrálie . Všechny tyto země klesly pod 6% v podílu uživatelů.
Reference
- ^ Blueprint.org
- ^ a b BOND v Unleashed Informatics Archived 14. března 2007 ve Wayback Machine
- ^ Snyder, K, et al. . Anotace vazebného místa pro malé molekuly na základě domén. BMC Bioinformatics 7: 152 (2006)
- ^ BIND na genomecanada.ca
- ^ a b c Bader, GD a kol. BIND - Síťová databáze biomolekulárních interakcí. Nucleic Acids Research 29: 242-245 (2001).
- ^ Bader, GD, Hogue, CWV. BIND - specifikace dat pro ukládání a popis biomolekulárních interakcí, molekulárních komplexů a cest. Bioinformatics 16 (5): 465-477 (2000).
- ^ a b c d e f Alfarano, C a kol. Aktualizuje se síťová databáze pro biomolekulární interakce a související nástroje z roku 2005. Nucleic Acids Research 33: D418-D424 (2005).
- ^ Bader, GD a kol. . BIND: síťová databáze biomolekulárních interakcí. Nucleic Acids Research 31: 248-250 (2003).