Databank over biomolekylært objektnetværk - Biomolecular Object Network Databank

Den biomolekylær Object Network Databank er en bioinformatik databank med oplysninger om lavmolekylære strukturer og interaktioner. Databanken integrerer et antal eksisterende databaser for at give et omfattende overblik over den information, der i øjeblikket er tilgængelig for et givet molekyle.

Baggrund

BÅND
Udvikler (r) Christopher Hogue et al., Samuel Lunenfeld Research Institute, Sinai-bjerget. Kommercielle rettigheder: Unleashed Informatics
Stabil frigivelse
BIND 4.0, SMIDsuite
Type Bioinformatik værktøj
Licens Åben adgang
Internet side [1]

Blueprint-initiativet startede som et forskningsprogram i laboratoriet af Dr.Christopher Hogue på Samuel Lunenfeld Research InstituteMount Sinai Hospital i Toronto . Den 14. december 2005 erhvervede Unleashed Informatics Limited de kommercielle rettigheder til The Blueprint Initiative intellektuelle ejendomsret . Dette omfattede rettigheder til proteininteraktionsdatabasen BIND, den lille molekyle-interaktionsdatabase SMID samt datalageret SeqHound. Unleashed Informatics er en datastyringstjenesteudbyder og fører tilsyn med ledelsen og kurateringen af ​​The Blueprint Initiative under vejledning af Dr. Hogue.

Konstruktion

BOND integrerer de originale Blueprint Initiative-databaser såvel som andre databaser, såsom Genbank , kombineret med mange nødvendige værktøjer til at analysere disse data. Annotationslink til sekvenser, herunder taxon-identifikatorer, overflødige sekvenser, genontologibeskrivelser , online-mendelske arv i mand- identifikatorer, konserverede domæner , krydshenvisninger til databaser, LocusLink-identifikatorer og komplette genomer er også tilgængelige. BOND letter tværdatabaseforespørgsler og er en open access- ressource, der integrerer interaktions- og sekvensdata.

Small Molecule Interaction Database (SMID)

Den lille molekyle- interaktionsdatabase er en database, der indeholder protein-domæne-lille molekyle-interaktioner. Det bruger en domænebaseret tilgang til at identificere domæne familier, der findes i Conserved Domain Database (CDD), der interagerer med et lille forespørgsel molekyle. CDD fra NCBI samler data fra flere forskellige kilder; Protein FAMilies (PFAM), Simple Modular Architecture Research Tool (SMART), Cluster of Orthologous Genes (COG'er) og NCBIs egne kuraterede sekvenser. Dataene i SMID stammer fra Protein Data Bank (PDB), en database med kendte proteinkrystalstrukturer. SMID kan forespørges ved at indtaste et protein GI, domæne-id, PDB ID eller SMID ID. Resultaterne af en søgning giver information om små molekyler, proteiner og domæner for hver interaktion identificeret i databasen. Interaktioner med ikke-biologiske kontakter screenes normalt ud som standard.

SMID-BLAST er et værktøj udviklet til at kommentere kendte småmolekylebindingssteder samt til at forudsige bindingssteder i proteiner, hvis krystalstrukturer endnu ikke er bestemt. Forudsigelsen er baseret på ekstrapolering af kendte interaktioner, der findes i PDB, til interaktioner mellem et ukrystalliseret protein med et lille molekyle af interesse. SMID-BLAST blev valideret mod et testsæt af kendte småmolekyleinteraktioner fra PDB. Det viste sig at være en nøjagtig forudsigelse af interaktioner mellem protein og lille molekyle; 60% af de forudsagte interaktioner matchede identisk med det PDB-kommenterede bindingssted, og af disse havde 73% mere end 80% af bindingsresterne af det korrekt identificerede protein. Hogue, C et al. anslog, at 45% af forudsigelserne, der ikke blev observeret i FBF-dataene, faktisk repræsenterer sande positive.

Biomolekylær interaktionsnetværksdatabase (BIND)

Introduktion

Idéen med en database til dokumentation af alle kendte molekylære interaktioner blev oprindeligt fremsat af Tony Pawson i 1990'erne og blev senere udviklet af forskere ved University of Toronto i samarbejde med University of British Columbia . Udviklingen af ​​den biomolekylære interaktionsnetværksdatabase (BIND) er blevet støttet af tilskud fra de canadiske institutter for sundhedsforskning ( CIHR ), genom Canada, den canadiske fond for innovation og Ontario Research and Development Fund. BIND blev oprindeligt designet til at være et konstant voksende depot for information om biomolekylære interaktioner, molekylære komplekser og veje. Da proteomics er et hurtigt fremadskridende felt, er der et behov for at have information fra videnskabelige tidsskrifter, der er let tilgængelige for forskere. BIND letter forståelsen af ​​molekylære interaktioner og veje involveret i cellulære processer og vil til sidst give forskere en bedre forståelse af udviklingsprocesser og sygdomspatogenese

De vigtigste mål for BIND-projektet er: at skabe en offentlig proteomikressource, der er tilgængelig for alle; at skabe en platform, der muliggør datamining fra andre kilder (PreBIND); at skabe en platform, der er i stand til at præsentere visualiseringer af komplekse molekylære interaktioner. Fra begyndelsen har BIND været open access, og software kan distribueres og ændres frit. I øjeblikket inkluderer BIND en dataspecifikation, en database og tilknyttede data mining og visualiseringsværktøjer. Til sidst håber man, at BIND vil være en samling af alle interaktioner, der forekommer i hver af de største modelorganismer.

Databasestruktur

BIND indeholder information om tre typer data: interaktioner, molekylære komplekser og veje.

  1. Interaktioner er den grundlæggende komponent i BIND og beskriver, hvordan 2 eller flere objekter (A og B) interagerer med hinanden. Objekterne kan være forskellige ting: DNA , RNA , gener , proteiner , ligander eller fotoner . Interaktionsposten indeholder mest information om et molekyle; den giver information om dets navn og synonymer, hvor den findes (f.eks. hvor i cellen, hvilken art, hvornår den er aktiv osv.), og dens sekvens, eller hvor dens sekvens kan findes. Interaktionsindgangen skitserer også de eksperimentelle betingelser, der kræves for at observere binding in vitro, kemisk dynamik (inklusive termodynamik og kinetik ).
  2. Den anden type BIND-poster er de molekylære komplekser. Molekylære komplekser defineres som et aggregat af molekyler, der er stabile og har en funktion, når de er bundet til hinanden. Posten kan også indeholde nogle oplysninger om kompleksets rolle i forskellige interaktioner, og den molekylære kompleksindgang forbinder data fra 2 eller flere interaktionsregistreringer.
  3. Den tredje komponent i BIND er sektionen for registrering af sti. En sti består af et netværk af interaktioner, der er involveret i reguleringen af ​​cellulære processer. Dette afsnit kan også indeholde oplysninger om fænotyper og sygdomme relateret til vejen.


Den mindste mængde information, der er nødvendig for at oprette en post i BIND, er en PubMed- publikationsreference og en post i en anden database (f.eks. GenBank ). Hver post i databasen indeholder referencer / forfattere til dataene. Da BIND er en konstant voksende database, sporer alle komponenter i BIND opdateringer og ændringer.

BIND er baseret på en dataspecifikation skrevet ved hjælp af Abstract Syntax Notation 1 ( ASN.1 ) sprog. ASN.1 bruges også af NCBI ved lagring af data til deres Entrez- system og på grund af dette bruger BIND de samme standarder som NCBI til datarepræsentation. ASN.1-sproget foretrækkes, fordi det let kan oversættes til andre dataspecifikationssprog (f.eks. XML ), let kan håndtere komplekse data og kan anvendes på alle biologiske interaktioner - ikke kun proteiner. Bader og Hogue (2000) har udarbejdet et detaljeret manuskript om ASN.1 dataspecifikation brugt af BIND.

Dataindsendelse og kurering

Brugerindlevering til databasen tilskyndes. For at bidrage til databasen skal man indsende: kontaktinformation, PubMed- id og de to molekyler, der interagerer. Den person, der indsender en post, er ejeren af ​​den. Alle poster valideres, inden de offentliggøres, og BIND kurateres for kvalitetssikring. BIND-kurering har to spor: HTP (high-throughput) og LTP (low-throughput). HTP-poster er fra papirer, der har rapporteret mere end 40 interaktionsresultater fra en eksperimentel metode. HTP-kuratorer har typisk en bioinformatikbaggrund . HTP-kuratorerne er ansvarlige for indsamling af lagring af eksperimentelle data, og de opretter også scripts til opdatering af BIND baseret på nye publikationer. LTP-poster kurateres af personer med enten en kandidatgrad eller ph.d. og laboratorieerfaring i interaktionsforskning. LTP-kuratorer får videreuddannelse gennem de canadiske bioinformatik-workshops . Oplysninger om kemi med små molekyler kurateres separat af kemikere for at sikre, at kuratoren er vidende om emnet. Prioriteten for BIND-kurering er at fokusere på LTP for at indsamle oplysninger, når de offentliggøres. Selvom HTP-undersøgelser giver mere information på én gang, rapporteres der flere LTP-undersøgelser, og lignende antal interaktioner rapporteres af begge spor. I 2004 indsamlede BIND data fra 110 tidsskrifter.

Database vækst

BIND er vokset markant siden sin undfangelse; Faktisk så databasen en ti gange stigning i poster mellem 2003 og 2004. I september 2004 var der over 100.000 interaktionsregistreringer inden 2004 (inklusive 58.266 protein-protein, 4.225 genetisk, 874 protein-lille molekyle, 25.857 protein-DNA, og 19.348 biopolymerinteraktioner). Databasen indeholder også sekvensinformation for 31.972 proteiner, 4560 DNA-prøver og 759 RNA-prøver. Disse poster er samlet fra 11.649 publikationer; derfor repræsenterer databasen en vigtig sammenlægning af data. Organismerne med poster i databasen inkluderer: Saccharomyces cerevisiae , Drosophila melanogaster , Homo sapiens , Mus musculus , Caenorhabditis elegans , Helicobacter pylori , Bos taurus , HIV-1 , Gallus gallus , Arabidopsis thaliana samt andre. I alt blev 901 taxa inkluderet i september 2004, og BIND er opdelt i BIND-Metazoa, BIND-Fungi og BIND-Taxroot.

Ikke kun opdateres oplysningerne i databasen løbende, selve softwaren har gennemgået flere revisioner. Version 1.0 af BIND blev frigivet i 1999 og baseret på brugerfeedback blev den modificeret til at omfatte yderligere detaljer om eksperimentelle betingelser, der kræves til binding, og en hierarkisk beskrivelse af interaktionens cellulære placering. Version 2.0 blev udgivet i 2001 og indeholdt muligheden for at linke til information tilgængelig i andre databaser. Version 3.0 (2002) udvidede databasen fra fysiske / biokemiske interaktioner til også at omfatte genetiske interaktioner. Version 3.5 (2004) inkluderede en raffineret brugergrænseflade, der havde til formål at forenkle hentning af information. I 2006 blev BIND indarbejdet i Biomolecular Object Network Database (BOND), hvor den fortsat opdateres og forbedres.

Særlige funktioner

BIND var den første database af sin art, der indeholdt information om biomolekylære interaktioner, reaktioner og veje i et skema. Det er også den første, der baserer sin ontologi på kemi, som tillader 3D-repræsentation af molekylære interaktioner. Den underliggende kemi gør det muligt at beskrive molekylære interaktioner ned til atomens niveau af opløsning.

FORBIND et tilknyttet system til datamining til lokalisering af information om biomolekylær interaktion i den videnskabelige litteratur. Navnet eller tiltrædelsesnummeret på et protein kan indtastes, og PreBIND scanner litteraturen og returnerer en liste over potentielt interagerende proteiner. BIND BLAST er også tilgængelig for at finde interaktioner med proteiner, der ligner den, der er specificeret i forespørgslen.

BIND tilbyder flere "funktioner", som mange andre proteomics-databaser ikke inkluderer. Forfatterne af dette program har oprettet en udvidelse til den traditionelle IUPAC- nomenklatur for at hjælpe med at beskrive ændringer efter translation, der forekommer i aminosyrer. Disse modifikationer indbefatter: acetylering , formylering , methylering , palmitoylering osv. Forlængelsen af ​​de traditionelle IUPAC-koder tillader også, at disse aminosyrer repræsenteres i sekvensform. BIND bruger også et unikt visualiseringsværktøj kendt som OntoGlyphs . OntoGlyphs blev udviklet baseret på genetisk ontologi (GO) og giver et link tilbage til de originale GO-oplysninger. Et antal GO-termer er grupperet i kategorier, hver repræsenterer en bestemt funktion, bindingsspecificitet eller lokalisering i cellen. Der er i alt 83 tegn på OnGlyph. Der er 34 funktionelle OntoGlyphs, som indeholder information om molekylets rolle (f.eks. Cellefysiologi, iontransport, signalering). Der er 25 bindende OntoGlyphs, der beskriver, hvad molekylet binder (f.eks. Ligander, DNA, ioner). De andre 24 OntoGlyphs giver information om placeringen af ​​molekylet i en celle (f.eks. Kerne, cytoskelet). OntoGlyphs kan vælges og manipuleres til at inkludere eller ekskludere bestemte egenskaber fra søgeresultaterne. Den visuelle karakter af OntoGlyphs letter også mønstergenkendelse, når man ser på søgeresultater. ProteoGlyphs er grafiske repræsentationer af proteins strukturelle og bindende egenskaber på niveau med konserverede domæner. Proteinet er skematisk vist som en lige vandret linje, og glyffer indsættes for at repræsentere konserverede domæner. Hver glyf vises for at repræsentere den relative position og længde af dens justering i proteinsekvensen.

Adgang til databasen

Image
Figur 1: Skærmbillede af sekvensresultater opnået ved hjælp af BOND

Databasens brugergrænseflade er webbaseret og kan forespørges ved hjælp af tekst eller tiltrædelsesnumre / identifikatorer. Siden dets integration med de andre komponenter i BOND er sekvenser blevet tilføjet til interaktioner, molekylære komplekser og veje i resultaterne. Optegnelser inkluderer information om: BIND-ID, beskrivelse af interaktionen / komplekset / stien, publikationer, opdateringsregistreringer, organisme, OntoGlyphs, ProteoGlyphs og links til andre databaser, hvor yderligere information kan findes. BIND-poster inkluderer forskellige visningsformater (f.eks. HTML , ASN.1 , XML , FASTA ), forskellige formater til eksport af resultater (f.eks. ASN.1, XML , GI-liste , PDF ) og visualiseringer (f.eks. Cytoscape ). De nøjagtige visnings- og eksportmuligheder varierer afhængigt af, hvilken type data der er hentet.

Brugerstatistikker

Antallet af Unleashed Registrants er steget 10 gange siden integrationen af ​​BIND. Fra december 2006 faldt registreringen kun under 10.000. Abonnenter på de kommercielle versioner af BOND falder i seks generelle kategorier; landbrug og fødevarer , bioteknologi , lægemidler , informatik , materialer og andet. Bioteknologisektoren er den største af disse grupper med 28% af abonnementerne. Lægemidler og informatik følger med henholdsvis 22% og 18%. Den USA holder hovedparten af disse abonnementer, 69%. Andre lande med adgang til de kommercielle versioner af BOND inkluderer Canada , Storbritannien , Japan , Kina , Korea , Tyskland , Frankrig , Indien og Australien . Alle disse lande falder under 6% i brugerandel.

Referencer

  1. ^ Blueprint.org
  2. ^ a b BOND på Unleashed Informatics Arkiveret 14. marts 2007 på Wayback Machine
  3. ^ Snyder, K, et al. . Domæne-baseret kommentar til bindingssted med lille molekyle. BMC Bioinformatics 7: 152 (2006)
  4. ^ BIND på genomecanada.ca
  5. ^ a b c Bader, GD, et al. BIND - Den biomolekylære interaktionsnetværksdatabase. Nucleic Acids Research 29: 242-245 (2001).
  6. ^ Bader, GD, Hogue, CWV. BIND - en dataspecifikation til lagring og beskrivelse af biomolekylære interaktioner, molekylære komplekser og veje. Bioinformatik 16 (5): 465-477 (2000).
  7. ^ a b c d e f Alfarano, C, et al. Databasen over biomolekylært interaktionsnetværk og relaterede værktøjer 2005. Nucleic Acids Research 33: D418-D424 (2005).
  8. ^ Bader, GD, et al. . BIND: den biomolekylære interaktionsnetværksdatabase. Nucleic Acids Research 31: 248-250 (2003).