Ir al contenido
Menú principal
Menú principal
mover a la barra lateral
ocultar
Navegación
Página principal
Cambios recientes
Página aleatoria
Ayuda sobre MediaWiki
Buscar
Buscar
español
Apariencia
Crear una cuenta
Acceder
Herramientas personales
No has accedido
Discusión
Contribuciones
Crear una cuenta
Acceder
Editando
BioJava
(sección)
Página
Discusión
español
Leer
Editar
Editar código
Ver historial
Herramientas
Herramientas
mover a la barra lateral
ocultar
Acciones
Leer
Editar
Editar código
Ver historial
General
Lo que enlaza aquí
Cambios relacionados
Información de la página
Apariencia
mover a la barra lateral
ocultar
Advertencia:
no has iniciado sesión. Tu dirección IP se hará pública si haces cualquier edición. Si
inicias sesión
o
creas una cuenta
, tus ediciones se atribuirán a tu nombre de usuario, además de otros beneficios.
Comprobación antispam. ¡
No
rellenes esto!
== Módulos == Durante los últimos 2 años, gran parte de la [[base de código]] original se han reescrito. BioJava 3 es una clara desviación de la serie de la versión 1. Ahora se compone de varios módulos independientes construidos usando una herramienta de automatización llamada [[Apache Maven]].<ref>{{cite web|last=Maven|first=Apache|title=Maven|url=http://maven.apache.org|publisher=Apache}}</ref> Estos módulos proporcionan herramientas del estado del arte para la comparación de la estructura de proteínas, por parejas y múltiples alineamientos de secuencias, trabajando con [[ADN]] y secuencias de proteínas, análisis de propiedades de aminoácidos, la detección de modificaciones de proteínas y predicción de las desordenadas regiones en las proteínas, así como analizadores de formatos de archivo comunes utilizando un [[modelo de datos]] biológicamente significativos. El código original ha pasado a un proyecto separado del proyecto [https://web.archive.org/web/20130109110621/http://www.biojava.org/docs/api1.8.2/ BioJava legacy], que todavía está disponible para la compatibilidad hacia atrás. Las siguientes secciones describen varios de los nuevos módulos y ponen de relieve algunas de las nuevas características que se incluyen en la versión más reciente de BioJava. Estructuras proteicas: biojava-structure, biojava-alignment Optional module: biojava-structure-gui for the 3D visualisation Optional external library : JmolApplet.jar for the 3D visualisation Alineamientos: biojava-alignment, biojava-core, biojava-phylo Required external library: forester.jar Genomas: biojava-genome. Secuenciación: biojava-core,biojava-sequencing, Required external library: guava-11.0.1.jar Árbol Filogenético: biojava-core, Required external library: forester.jar Propiedades Físico-químicas: biojava-aa-prop, biojava-structure and biojava-core Desorden de Proteínas: biojava-protein-disorder. Identificación de Proteínas Modificadas: biojava-modfinder, biojava-structure Llamadas a Web-Services: biojava-core, biojava-ws === Módulo Principal === Este módulo ofrece [[clases]] Java para modelar secuencias de [[aminoácidos]] o [[nucleótidos]]. Las clases se han diseñado teniendo en cuenta que deben ser conocidos por los biólogos, es decir, los nombres deben tener sentido para los biólogos y al mismo tiempo también proporcionan una representación concreta de los pasos para pasar de una secuencia de genes a una secuencia de la proteína para los científicos de la computación y programadores. Un cambio importante entre el proyecto BioJava Legacy y BioJava3 radica en la forma que ha sido diseñado el framework para aprovechar las últimas innovaciones en Java. Una secuencia se define como una interfaz genérica permitiéndole al resto de los módulos crear cualquier utilidad que opera en todas las secuencias. Clases específicas para las secuencias comunes, tales como ADN y proteínas se han definido con el fin de mejorar la usabilidad para los biólogos. El motor de traducción realmente aprovecha este trabajo al permitir que las conversiones entre las secuencias de ADN, ARN y aminoácidos. Este motor puede manejar los detalles tales como la elección de la tabla de codones, la conversión de codones de inicio de metionina, el recorte de los codones de parada, especificando el marco de lectura y la entrega de secuencias ambiguas. Se ha prestado atención especial en el diseño del almacenamiento de las secuencias a fin de minimizar los requisitos de espacio. Patrones de diseño especiales, como el [[Proxy_pattern|patrón Proxy]] que permitió a los desarrolladores crear el framework de manera tal que las secuencias se puedan almacenar en la memoria, la demanda de un servicio web como UniProt o leer desde un archivo [[FASTA]] según sea necesario. Los dos últimos enfoques ahorran memoria al no cargar datos de la secuencia hasta que se hace referencia en la solicitud. Este concepto se puede ampliar para manejar grandes bases de datos genómicas, tales como [[NCBI]], [[GenBank]] o una base de datos propietaria. === Módulos de Estructura de Proteínas === [[Archivo:This window shows two proteins with IDs "4hhb.A" and "4hhb.B" aligned against each other.png|Esta ventana muestra dos proteínas con IDs "4hhb.A" y "4hhb.B" alineados una contra la otra. El código se muestra en el lado izquierdo. Esto se produce utilizando bibliotecas BioJava que a su vez utiliza visor de Jmol. El FATCAT<ref name="fatcat">{{cite journal |author=Ye Y, Godzik A |title=Flexible structure alignment by chaining aligned fragment pairs allowing twists |journal=Bioinformatics |volume=19 |issue=Suppl 2|pages=ii246–55 |date=October 2003 |pmid=14534198 |url=http://bioinformatics.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=14534198 |doi=10.1093/bioinformatics/btg1086}}</ref> algoritmo rígido que se utiliza aquí para hacer la alineación.]] Los módulos de estructura de proteínas proporcionan herramientas para representar y manipular estructuras biomoleculares 3D. En particular, se centra en la comparación de la estructura de proteínas. Los siguientes algoritmos se han aplicado y se incluyen en BioJava. Algoritmo FATCAT para la alineación del cuerpo flexible y rígido.[17] El algoritmo estándar Combinatoria de Extensión (CE).<ref>{{cite journal |author=Shindyalov IN, Bourne PE |title=Protein structure alignment by incremental combinatorial extension (CE) of the optimal path |journal=Protein Eng. |volume=11 |issue=9 |pages=739–47 |date=September 1998 |pmid=9796821 |url=http://peds.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=9796821 |doi=10.1093/protein/11.9.739}}</ref> Una nueva versión de la CE que puede detectar permutaciones circulares en las proteínas.<ref>{{cite journal |author=Bliven S, Prlić A |title=Circular permutation in proteins |journal=PLoS Comput. Biol. |volume=8 |issue=3 |pages=e1002445 |year=2012 |pmid=22496628 |pmc=3320104 |doi=10.1371/journal.pcbi.1002445 |url=http://dx.plos.org/10.1371/journal.pcbi.1002445}}</ref> Estos algoritmos se utilizan para proporcionar al RCSB Protein Data Bank (PDB)<ref>{{cite journal |author=Rose PW, Beran B, Bi C |title=The RCSB Protein Data Bank: redesigned web site and web services |journal=Nucleic Acids Res. |volume=39 |issue=Database issue |pages=D392–401 |date=January 2011 |pmid=21036868 |pmc=3013649 |doi=10.1093/nar/gkq1021 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=21036868|display-authors=etal}}</ref> La herramienta de comparación de proteínas, así como comparaciones sistemáticas de todas las proteínas en el PDB semanalmente.<ref>{{cite journal |author=Prlic A, Bliven S, Rose PW |title=Pre-calculated protein structure alignments at the RCSB PDB website |journal=Bioinformatics |volume=26 |issue=23 |pages=2983–5 |date=December 2010 |pmid=20937596 |pmc=3003546 |doi=10.1093/bioinformatics/btq572 |url=http://bioinformatics.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=20937596|display-authors=etal}}</ref> Analizadores de formatos de archivos de PDB<ref>{{cite journal |author=Bernstein FC, Koetzle TF, Williams GJ |title=The Protein Data Bank: a computer-based archival file for macromolecular structures |journal=J. Mol. Biol. |volume=112 |issue=3 |pages=535–42 |date=May 1977 |pmid=875032 |doi=10.1016/s0022-2836(77)80200-3 |display-authors=etal}}</ref> y mmCIF<ref>Fitzgerald,P.M.D. et al. (2006) Macromolecular dictionary (mmCIF). In Hall,S.R.</ref> permiten la carga de datos de la estructura en un modelo de datos reutilizable. Esta característica es utilizada por el proyecto SIFTS para mapear entre las secuencias de UniProt y estructuras de PDB.<ref>{{cite journal |author=Velankar S, McNeil P, Mittard-Runte V |title=E-MSD: an integrated data resource for bioinformatics |journal=Nucleic Acids Res. |volume=33 |issue=Database issue |pages=D262–5 |date=January 2005 |pmid=15608192 |pmc=540012 |doi=10.1093/nar/gki058 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=15608192|display-authors=etal}}</ref> Información de la RCSB PDB puede ser dinámicamente obtenida y sin la necesidad de descargar manualmente los datos. Para la visualización, se proporciona una interfaz para el visor 3D Jmol (http://www.jmol.org/) . El equipo afirma que se está trabajando para mejorar la interacción con los viewers de RCSB PDB.<ref>{{cite journal |author=Moreland JL, Gramada A, Buzko OV, Zhang Q, Bourne PE |title=The Molecular Biology Toolkit (MBT): a modular platform for developing molecular visualization applications |journal=BMC Bioinformatics |volume=6 |issue= |pages=21 |year=2005 |pmid=15694009 |pmc=548701 |doi=10.1186/1471-2105-6-21 |url=http://www.biomedcentral.com/1471-2105/6/21}}</ref> A continuación se muestra un esquema del código para inicializar una ventana que mostrará y comparará dos secuencias de proteínas. Por favor, tenga en cuenta que esto es sólo un esbozo del código. Para hacer este trabajo tendrá que importar el paquete correcto en "org.biojava.bio.structure" y también añadir manejar excepciones utilizando un bloque try-catch. <syntaxhighlight lang="java"> String name1 = "4hhb.A"; String name2 = "4hhb.B"; AtomCache cache = new AtomCache(); Structure structure1 = null; Structure structure2 = null; StructureAlignment algorithm = StructureAlignmentFactory.getAlgorithm(FatCatRigid.algorithmName); structure1 = cache.getStructure(name1); structure2 = cache.getStructure(name2); Atom[] ca1 = StructureTools.getAtomCAArray(structure1); Atom[] ca2 = StructureTools.getAtomCAArray(structure2); FatCatParameters params = new FatCatParameters(); AFPChain afpChain = algorithm.align(ca1,ca2,params); afpChain.setName1(name1); afpChain.setName2(name2); StructureAlignmentDisplay.display(afpChain, ca1, ca2); </syntaxhighlight> El código alinea las dos secuencias de proteínas "4hhb.A" y "4hhb.B" basado en el algoritmo rígido FATCAT. === Módulos Genoma y Secuenciación === Este módulo se centra en la creación de objetos de secuencias de genes desde el módulo principal. Esto se realiza mediante el apoyo al análisis de los siguientes formatos de archivo estándar populares generados por las aplicaciones de predicción de genes de código abierto: *Archivos GTF generados por GeneMark<ref>{{cite journal |author=Besemer J, Borodovsky M |title=GeneMark: web software for gene finding in prokaryotes, eukaryotes and viruses |journal=Nucleic Acids Res. |volume=33 |issue=Web Server issue |pages=W451–4 |date=July 2005 |pmid=15980510 |pmc=1160247 |doi=10.1093/nar/gki487 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=15980510}}</ref> *Archivos GFF2 generados por GeneID<ref>{{cite journal |author=Blanco E, Abril JF |title=Computational gene annotation in new genome assemblies using GeneID |journal=Methods Mol. Biol. |volume=537 |issue= |pages=243–61 |year=2009 |pmid=19378148 |doi=10.1007/978-1-59745-251-9_12 }}</ref> *Archivos GFF3 generados por Glimmer<ref>{{cite journal |author=Kelley DR, Liu B, Delcher AL, Pop M, Salzberg SL |title=Gene prediction with Glimmer for metagenomic sequences augmented by classification and clustering |journal=Nucleic Acids Res. |volume=40 |issue=1 |pages=e9 |date=January 2012 |pmid=22102569 |pmc=3245904 |doi=10.1093/nar/gkr1067 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=22102569}}</ref> A continuación, los objetos de secuencias de genes se escriben como un formato GFF3 y se importan en GMOD.<ref>{{cite journal |author=Stein LD, Mungall C, Shu S |title=The generic genome browser: a building block for a model organism system database |journal=Genome Res. |volume=12 |issue=10 |pages=1599–610 |date=October 2002 |pmid=12368253 |pmc=187535 |doi=10.1101/gr.403602 |url=http://genome.cshlp.org/cgi/pmidlookup?view=long&pmid=12368253|display-authors=etal}}</ref> Estos formatos de archivo están bien definidos, pero lo que se escribe en el archivo es muy flexible. En el siguiente código de ejemplo se toma un archivo 454scaffold, que fue utilizado por GeneMark para predecir genes, y devuelve una colección de ChromosomeSequences. Cada secuencia de cromosoma se asigna a una entrada llamada en el archivo FASTA y contendría N secuencias de genes. Las secuencias de genes pueden ser hebra +/- con cambios de marco y múltiples transcripciones. Pasando la colección de ChromosomeSequences a GeneFeatureHelper.getProteinSequences devolvería todas las secuencias de proteínas. A continuación, puede escribir las secuencias de proteínas a un archivo FASTA. <syntaxhighlight lang="java"> LinkedHashMap<String, ChromosomeSequence> chromosomeSequenceList = GeneFeatureHelper.loadFastaAddGeneFeaturesFromGeneMarkGTF(new File("454Scaffolds.fna"), new File("genemark_hmm.gtf")); LinkedHashMap<String, ProteinSequence> proteinSequenceList = GeneFeatureHelper.getProteinSequences(chromosomeSequenceList.values()); FastaWriterHelper.writeProteinSequence(new File("genemark_proteins.faa"), proteinSequenceList.values()); </syntaxhighlight> También puede dar salida a la secuencia del gen en un archivo fasta donde las regiones codificantes estarán en mayúscula y las regiones no codificantes estarán en minúscula. <syntaxhighlight lang="java"> LinkedHashMap<String, GeneSequence> geneSequenceHashMap = GeneFeatureHelper.getGeneSequences(chromosomeSequenceList.values()); Collection<GeneSequence> geneSequences = geneSequenceHashMap.values(); FastaWriterHelper.writeGeneSequence(new File("genemark_genes.fna"), geneSequences, true); </syntaxhighlight> Usted puede escribir fácilmente una vista GFF3 de un ChromosomeSequence con el siguiente código. <syntaxhighlight lang="java"> FileOutputStream fo = new FileOutputStream("genemark.gff3"); GFF3Writer gff3Writer = new GFF3Writer(); gff3Writer.write(fo, chromosomeSequenceList); fo.close(); </syntaxhighlight> Para la prestación de apoyo de entrada-salida por varias variantes comunes del formato de archivo FASTQ de los secuenciadores de última generación, se proporciona<ref>{{cite journal |author=Cock PJ, Fields CJ, Goto N, Heuer ML, Rice PM |title=The Sanger FASTQ file format for sequences with quality scores, and the Solexa/Illumina FASTQ variants |journal=Nucleic Acids Res. |volume=38 |issue=6 |pages=1767–71 |date=April 2010 |pmid=20015970 |pmc=2847217 |doi=10.1093/nar/gkp1137 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=20015970}}</ref> un módulo de secuenciación independiente. Se llama el módulo de secuencia y está contenido en el paquete org.biojava3.sequencing.io.fastq. Para las muestras sobre el uso de este módulo por favor haga clic aquí (http://biojava.org/wiki/BioJava:CookBook3:FASTQ). Se está trabajando para llegar a crear un conjunto completo de clases java para hacer conversiones entre diferentes formatos de archivo donde la lista de aplicaciones de predicción de genes compatibles y buscadores de genomas estarán ampliamente basadas en los requerimientos de los usuarios finales. === Módulo de Alineamiento === Este módulo contiene varias clases y métodos que permiten a los usuarios realizar alineamientos de secuencias por parejas y por secuencias múltiples. Pairwise alineación de secuencias Para la alineación global óptima, BioJava implementa el algoritmo [[Needleman–Wunsch_algorithm|Needleman-Wunsch]]<ref>{{cite journal |author=Needleman SB, Wunsch CD |title=A general method applicable to the search for similarities in the amino acid sequence of two proteins |journal=J. Mol. Biol. |volume=48 |issue=3 |pages=443–53 |date=March 1970 |pmid=5420325 |url=http://linkinghub.elsevier.com/retrieve/pii/0022-2836(70)90057-4 |doi=10.1016/0022-2836(70)90057-4}}</ref> y para realizar alineamientos locales implementa el algoritmo [[Smith–Waterman_algorithm|Smith y Waterman]].<ref>{{cite journal |author=Smith TF, Waterman MS |title=Identification of common molecular subsequences |journal=J. Mol. Biol. |volume=147 |issue=1 |pages=195–7 |date=March 1981 |pmid=7265238 |url=http://linkinghub.elsevier.com/retrieve/pii/0022-2836(81)90087-5 |doi=10.1016/0022-2836(81)90087-5}}</ref> Las salidas de ambos alineamientos locales y globales están disponibles en formatos estándar. Un ejemplo de cómo usar las bibliotecas se muestra a continuación. <syntaxhighlight lang="java"> protected void align(String uniProtID_1, String uniProtID_2, PairwiseSequenceAlignerType alignmentType) throws IOException, Exception { ProteinSequence proteinSeq1 = FastaReaderHelper.readFastaProteinSequence((new URL(String.format ("http://www.uniprot.org/uniprot/%s.fasta", uniProtID_1))).openStream()).get(uniProtID_1); ProteinSequence proteinSeq2 = FastaReaderHelper.readFastaProteinSequence((new URL(String.format ("http://www.uniprot.org/uniprot/%s.fasta", uniProtID_2))).openStream()).get(uniProtID_2); SequencePair<ProteinSequence, AminoAcidCompound> result = Alignments.getPairwiseAlignment(proteinSeq1, proteinSeq2, alignmentType, new SimpleGapPenalty(), new SimpleSubstitutionMatrix<AminoAcidCompound>()); System.out.println(result.toString()); } </syntaxhighlight> Un ejemplo de llamada a la función anterior sería algo como esto: Para un Alineamiento Global <syntaxhighlight lang="java"> align("Q21691", "Q21495", PairwiseSequenceAlignerType.GLOBAL); </syntaxhighlight> Para un Alineamiento Local <syntaxhighlight lang="java"> align("Q21691", "Q21495", PairwiseSequenceAlignerType.LOCAL); </syntaxhighlight> Además de estos dos algoritmos, existe una implementación del algoritmo de Guan-Uberbacher<ref>{{cite journal |author=Guan X, Uberbacher EC |title=Alignments of DNA and protein sequences containing frameshift errors |journal=Comput. Appl. Biosci. |volume=12 |issue=1 |pages=31–40 |date=February 1996 |pmid=8670617 |doi=10.1093/bioinformatics/12.1.31}}</ref> que lleva a cabo una alineación global de secuencias de manera muy eficiente ya que sólo utiliza la memoria lineal. Para alineamiento de secuencia múltiples, cualquiera de los métodos discutidos anteriormente pueden utilizarse para llevar a cabo progresivamente una alineación de secuencias múltiples. === Módulo ModFinder === [[Archivo:An_example_application_using_the_ModFinder_module_and_the_protein_structure_module.png|Una aplicación de ejemplo usando el módulo ModFinder y el módulo de estructuras de proteínas<ref>{{cite journal |author=Chen K, Jung YS, Bonagura CA |title=Azotobacter vinelandii ferredoxin I: a sequence and structure comparison approach to alteration of [4Fe-4S]2+/+ reduction potential |journal=J. Biol. Chem. |volume=277 |issue=7 |pages=5603–10 |date=February 2002 |pmid=11704670 |doi=10.1074/jbc.M108916200 |url=http://www.jbc.org/cgi/pmidlookup?view=long&pmid=11704670 |display-authors=etal }}</ref>]] El módulo ModFinder ofrece nuevos métodos para identificar y clasificar las modificaciones de proteínas en estructuras 3D de proteínas. Se recogieron y curaron más de 400 diferentes tipos de modificaciones de proteínas como la [[fosforilación]], [[glicosilación]], [[enlaces disulfuro]], quelación de metales, etc., basadas en anotaciones en PSI-MOD,<ref>{{cite journal |author=Montecchi-Palazzi L, Beavis R, Binz PA |title=The PSI-MOD community standard for representation of protein modification data |journal=Nat. Biotechnol. |volume=26 |issue=8 |pages=864–6 |date=August 2008 |pmid=18688235 |doi=10.1038/nbt0808-864 |display-authors=etal}}</ref> RESID<ref>{{cite journal |author=Garavelli JS |title=The RESID Database of Protein Modifications as a resource and annotation tool |journal=Proteomics |volume=4 |issue=6 |pages=1527–33 |date=June 2004 |pmid=15174122 |doi=10.1002/pmic.200300777 }}</ref> y RCSB PDB.<ref>{{cite journal |author=Berman HM, Westbrook J, Feng Z |title=The Protein Data Bank |journal=Nucleic Acids Res. |volume=28 |issue=1 |pages=235–42 |date=January 2000 |pmid=10592235 |pmc=102472 |doi=10.1093/nar/28.1.235|display-authors=etal}}</ref> El módulo también proporciona una API para la detección de modificaciones de proteínas dentro de las estructuras de las proteínas. Ejemplo: identificar e imprimir todas las modificaciones precargados de una estructura<ref>{{cite web|last=CookBook3|first=BioJava|title=ModFinder|url=http://biojava.org/wiki/BioJava:CookBook3:ModFinder}}</ref> <syntaxhighlight lang="java"> Set<ModifiedCompound> identifyAllModfications(Structure struc) { ProteinModificationIdentifier parser = new ProteinModificationIdentifier(); parser.identify(struc); Set<ModifiedCompound> mcs = parser.getIdentifiedModifiedCompound(); return mcs; } </syntaxhighlight> Ejemplo: identificar sitios de fosforilación en una estructura <syntaxhighlight lang="java"> List<ResidueNumber> identifyPhosphosites(Structure struc) { List<ResidueNumber> phosphosites = new ArrayList<ResidueNumber>(); ProteinModificationIdentifier parser = new ProteinModificationIdentifier(); parser.identify(struc, ProteinModificationRegistry.getByKeyword("phosphoprotein")); Set<ModifiedCompound> mcs = parser.getIdentifiedModifiedCompound(); for (ModifiedCompound mc : mcs) { Set<StructureGroup> groups = mc.getGroups(true); for (StructureGroup group : groups) { phosphosites.add(group.getPDBResidueNumber()); } } return phosphosites; } </syntaxhighlight> Código de demostración para ejecutar los métodos anteriores <syntaxhighlight lang="java"> import org.biojava.bio.structure.ResidueNumber; import org.biojava.bio.structure.Structure; import org.biojava.bio.structure.io.PDBFileReader; import org.biojava3.protmod.structure.ProteinModificationIdentifier; public static void main(String[] args) { try { PDBFileReader reader = new PDBFileReader(); reader.setAutoFetch(true); // identify all modifications from PDB:1CAD and print them String pdbId = "1CAD"; Structure struc = reader.getStructureById(pdbId); Set<ModifiedCompound> mcs = identifyAllModfications(struc); for (ModifiedCompound mc : mcs) { System.out.println(mc.toString()); } // identify all phosphosites from PDB:3MVJ and print them pdbId = "3MVJ"; struc = reader.getStructureById(pdbId); List<ResidueNumber> psites = identifyPhosphosites(struc); for (ResidueNumber psite : psites) { System.out.println(psite.toString()); } } catch(Exception e) { e.printStackTrace(); } } </syntaxhighlight> Hay planes para incluir las modificaciones adicionales a las proteínas mediante la integración de otros recursos como UniProt<ref>{{cite journal |author=Farriol-Mathis N, Garavelli JS, Boeckmann B |title=Annotation of post-translational modifications in the Swiss-Prot knowledge base |journal=Proteomics |volume=4 |issue=6 |pages=1537–50 |date=June 2004 |pmid=15174124 |doi=10.1002/pmic.200300764 |display-authors=etal}}</ref> === Módulo Propiedades de Aminoácidos === Este módulo trata de proporcionar las propiedades físico-químicas precisas de las proteínas. Las propiedades que pueden ser calculadas usando este módulo son los siguientes: * [[Masa molecular]] * [[Coeficiente de extinción]] * Índice de Inestabilidad * Índice alifáticos * Gran media de hidropatıa * [[Punto isoeléctrico]] * Composición de aminoácidos Los pesos moleculares precisos para los aminoácidos comunes marcados isotópicamente se incluyen en este módulo. También existe flexibilidad para definir nuevas moléculas de aminoácidos con sus pesos moleculares utilizando archivos de configuración sencilla [[XML]]. Esto puede ser útil donde la masa exacta es de gran importancia, tales como experimentos de [[espectrometría de masas]]. === Módulo de Desorden en la Proteína === El objetivo de este módulo es proporcionar a los usuarios maneras de encontrar desorden en las moléculas de proteína. BioJava incluye una implementación de Java del predictor RONN (http://bioinformatics.oxfordjournals.org/content/21/16/3369.full). La versión de BioJava (3.0.5) hace uso de la ayuda de Java para multithreading para mejorar el rendimiento hasta en 3,2 veces,<ref>{{cite journal |author=Yang ZR, Thomson R, McNeil P, Esnouf RM |title=RONN: the bio-basis function neural network technique applied to the detection of natively disordered regions in proteins |journal=Bioinformatics |volume=21 |issue=16 |pages=3369–76 |date=August 2005 |pmid=15947016 |doi=10.1093/bioinformatics/bti534 |url=http://bioinformatics.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=15947016}}</ref> en una máquina moderna de cuatro núcleos, en comparación con la implementación del legado C. Hay dos maneras de utilizar este módulo: * El uso de las llamadas a funciones de biblioteca * El uso de la línea de comandos Hacer llamadas a funciones de biblioteca Los siguientes ejemplos muestran cómo utilizar el módulo y hacer llamadas de función para obtener información acerca de los desórdenes de proteínas. En los dos primeros ejemplos se llama a una función de la biblioteca para calcular la probabilidad de desorden para cada residuo de la secuencia proporcionada. El tercer y cuarto ejemplo demuestran la facilidad con que se pueden obtener las regiones desordenadas de la proteína. Ejemplo 1: Calcular la probabilidad de desorden para cada residuo en la secuencia <syntaxhighlight lang="java"> FastaSequence fsequence = new FastaSequence("name", "LLRGRHLMNGTMIMRPWNFLNDHHFPKFFPHLIEQQAIWLADWWRKKHC" + "RPLPTRAPTMDQWDHFALIQKHWTANLWFLTFPFNDKWGWIWFLKDWTPGSADQAQRACTWFFCHGHDTN"); float[] rawProbabilityScores = Jronn.getDisorderScores(fsequence); </syntaxhighlight> Ejemplo 2: Calcular la probabilidad de desorden para cada residuo en la secuencia para todas las proteínas del archivo de entrada FASTA <syntaxhighlight lang="java"> final List<FastaSequence> sequences = SequenceUtil.readFasta(new FileInputStream("src/test/resources/fasta.in")); Map<FastaSequence, float[]> rawProbabilityScores = Jronn.getDisorderScores(sequences); </syntaxhighlight> Ejemplo 3: Obtener las regiones desordenada de la proteína para una sola secuencia de la proteína <syntaxhighlight lang="java"> FastaSequence fsequence = new FastaSequence("Prot1", "LLRGRHLMNGTMIMRPWNFLNDHHFPKFFPHLIEQQAIWLADWWRKKHC" + "RPLPTRAPTMDQWDHFALIQKHWTANLWFLTFPFNDKWGWIWFLKDWTPGSADQAQRACTWFFCHGHDTN" + "CQIIFEGRNAPERADPMWTGGLNKHIIARGHFFQSNKFHFLERKFCEMAEIERPNFTCRTLDCQKFPWDDP"); Range[] ranges = Jronn.getDisorder(fsequence); </syntaxhighlight> Ejemplo 4: Calcular las regiones desordenadas para las proteínas de archivo FASTA <syntaxhighlight lang="java"> final List<FastaSequence> sequences = SequenceUtil.readFasta(new FileInputStream("src/test/resources/fasta.in")); Map<FastaSequence, Range[]> ranges = Jronn.getDisorder(sequences); </syntaxhighlight> El uso de la línea de comandos BioJava módulo biojava3-protein-disorder se puede compilar en un solo archivo JAR ejecutable y ejecutar mediante el comando siguiente.<ref>{{cite web|last=CookBook3|first=BioJava|title=Protein Disorder CLI|url=http://biojava.org/wiki/BioJava:CookBook3:ProteinDisorderCLI}}</ref> java -jar <jar_file_name> Opciones admitidas por el ejecutable de línea de comandos JRONN version 3.1b usage 1 August 2011: java -jar JRONN_JAR_NAME -i=inputfile <OPTIONS> Where -i=input file Input file can contain one or more FASTA formatted sequences. All OPTIONS are optional OPTION DETAILED DESCRIPTION: -o full path to the output file, if not specified standard out is used -d the value of disorder, defaults to 0.5 -f output format, V for vertical, where the letters of the sequence and corresponding disorder values are output in two column layout. H for horizontal, where the disorder values are provided under the letters of the sequence. Letters and values separated by tabulation in this case. Defaults to V. -s the file name to write execution statistics to. -n the number of threads to use. Defaults to the number of cores available on the computer. n=1 mean sequential processing. Valid values are 1 < n < (2 x num_of_cores) Default value will give the best performance. Ejemplos Predecir los valores de desorden para las secuencias desde un archivo de entrada /home/input.fasta a una salida estándar de resultados. Utiliza un valor predeterminado de desorden y también utilizar todas las CPU disponibles en el equipo. java -jar JRONN.JAR -i=/home/input.fasta Predecir los valores de desorden para las secuencias desde una archivo de entrada /home/input.fasta los resultados en disposición horizontal a /home/jronn.out, recopilan estadísticas de ejecución al archivo /home/jronn.stat.txt y limitan el número de threads a dos. java -jar JRONN.JAR -i=/home/input.fasta -o=/home/jronn.out -d=0.6 -n=2 -f=H Los argumentos se pueden proporcionar en cualquier orden. === Módulo de acceso a servicio Web === De acuerdo con las tendencias actuales en la bioinformática, herramientas basadas en web están ganando popularidad. El módulo de servicio web permite a los servicios de bioinformática para acceder a través de protocolos [[REST]]. Actualmente, dos servicios se implementan:. [[NCBI]] [[Blast]] a través de la Blast URLAPI (anteriormente conocido como QBlast) y el servicio de HMMER web.<ref>{{cite journal |author=Finn RD, Clements J, Eddy SR |title=HMMER web server: interactive sequence similarity searching |journal=Nucleic Acids Res. |volume=39 |issue=Web Server issue |pages=W29–37 |date=July 2011 |pmid=21593126 |pmc=3125773 |doi=10.1093/nar/gkr367 |url=http://nar.oxfordjournals.org/cgi/pmidlookup?view=long&pmid=21593126}}</ref>
Resumen:
Al guardar los cambios aceptas los
términos de uso
y liberas de forma irrevocable tu contribución conforme a los términos de las licencias
licencia CC BY-SA 4.0
y
GFDL
. Aceptas igualmente que un hipervínculo o URL es atribución suficiente conforme a la licencia Creative Commons.
Cancelar
Ayuda de edición
(se abre en una ventana nueva)
Buscar
Buscar
Editando
BioJava
(sección)
Añadir idiomas
Añadir tema