TY - THES A1 - Koetschan, Christian T1 - The Eukaryotic ITS2 Database - A workbench for modelling RNA sequence-structure evolution T1 - Die Eukaryotische ITS2 Datenbank - Eine Plattform zur Modellierung von RNA Sequenzstruktur Evolution N2 - In den vergangenen Jahren etablierte sich der Marker „internal transcribed spacer 2" (ITS2) zu einem häufig genutzten Werkzeug in der molekularen Phylogenetik der Eukaryoten. Seine schnell evolvierende Sequenz eignet sich bestens für den Einsatz in niedrigeren phylogenetischen Ebenen. Die ITS2 faltet jedoch auch in eine sehr konservierte Sekundärstruktur. Diese ermöglicht die Unterscheidung weit entfernter Arten. Eine Kombination aus beiden in einer Sequenzstrukturanalyse verbessert die Auflösung des Markers und ermöglicht die Rekonstruktion von robusteren Bäumen auf höherer taxonomischer Breite. Jedoch war die Durchführung solch einer Analyse, die die Nutzung unterschiedlichster Programme und Datenbanken vorraussetzte, für den klassischen Biologen nicht einfach durchführbar. Um diese Hürde zu umgehen, habe ich den „ITS2 Workbench“ entwickelt, eine im Internet nutzbare Arbeitsplattform zur automatisierten sequenzstrukturbasierten phylogenetischen Analyse basierend auf der ITS2 (http://its2.bioapps.biozentrum.uni-wuerzburg.de). Die Entwicklung begann mit der Längenoptimierung unterschiedlicher „Hidden Markov Model“ (HMM)-Topologien, die erfolgreich auf ein Modell zur Sequenzstrukturvorhersage der ITS2 angewandt wurden. Hierbei wird durch die Analyse von Sequenzbestandteilen in Kombination mit der Längenverteilung verschiedener Helixregionen die Struktur vorhergesagt. Anschließend konnte ich HMMs auch bei der Sequenzstrukturgenerierung einsetzen um die ITS2 innerhalb einer gegebenen Sequenz zu lokalisieren. Dieses neu implementierte Verfahren verdoppelte die Anzahl vorhergesagter Strukturen und verkürzte die Laufzeit auf wenige Tage. Zusammen mit weiteren Optimierungen des Homologiemodellierungsprozesses kann ich nun erschöpfend Sekundärstrukturen in mehreren Interationen vorhersagen. Diese Optimierungen liefern derzeit 380.000 annotierte Sequenzen einschließlich 288.000 Strukturvorhersagen. Um diese Strukturen für die Berechnung von Alignments und phylogenetischen Bäumen zu verwenden hab ich das R-Paket „treeforge“ entwickelt. Es ermöglicht die Generierung von Sequenzstrukturalignments auf bis zu vier unterschiedlich kodierten Alphabeten. Damit können erstmals auch strukturelle Basenpaarungen in die Alignmentberechnung mit einbezogen werden, die eine Schätzung neuer Scorematrizen vorraussetzten. Das R-Paket ermöglicht zusätzlich die Rekonstruktion von „Maximum Parsimony“, „Maximum Likelihood“ und „Neighbour Joining“ Bäumen auf allen vier Alphabeten mittels weniger Zeilen Programmcode. Das Paket wurde eingesetzt, um die noch umstrittene Phylogenie der „chlorophyceae“ zu rekonstruieren und könnte in zukünftigen Versionen des ITS2 workbench verwendet werden. Die ITS2 Plattform basiert auf einer modernen und sehr umfangreichen Web 2.0 Oberfläche und beinhaltet neuste AJAX und Web-Service Technologien. Sie umfasst die HMM basierte Sequenzannotation, Strukturvorhersage durch Energieminimierung bzw. Homologiemodellierung, Alignmentberechnung und Baumrekonstruktion basierend auf einem flexiblen Datenpool, der Änderungen am Datensatz automatisch aktualisiert. Zusätzlich wird eine Detektion von Sequenzmotiven ermöglicht, die zur Kontrolle von Annotation und Strukturvorhersage dienen kann. Eine BLAST basierte Suche auf Sequenz- und Strukturebene bietet zusätzlich eine Vereinfachung des Taxonsamplings. Alle Funktionen sowie die Nutzung der ITS2 Webseite sind in einer kurzen Videoanleitung dargestellt. Die Plattform lässt jedoch nur eine bestimmte Größe von Datensätzen zu. Dies liegt vor allem an der erheblichen Rechenleistung, die bei diesen Berechnungen benötigt wird. Um die Funktion dieses Verfahrens auch auf großen Datenmengen zu demonstrieren, wurde eine voll automatisierte Rekonstruktion des Grünalgenbaumes (Chlorophyta) durchgeführt. Diese erfolgreiche, auf dem ITS2 Marker basierende Studie spricht für die Sequenz-Strukturanalyse auf weiteren Daten in der Phylogenetik. Hier bietet der ITS2 Workbench den idealen Ausgangspunkt. N2 - During the past years, the internal transcribed spacer 2 (ITS2) was established as a commonly used molecular phylogenetic marker for the eukaryotes. Its fast evolving sequence is predestinated for the use in low-level phylogenetics. However, the ITS2 also consists of a very conserved secondary structure. This enables the discrimination between more distantly related species. The combination of both in a sequence-structure based analysis increases the resolution of the marker and enables even more robust tree reconstructions on a broader taxonomic range. But, performing such an analysis required the application of different programs and databases making the use of the ITS2 non trivial for the typical biologist. To overcome this hindrance, I have developed the ITS2 Workbench, a completely web-based tool for automated phylogenetic sequence-structure analyses using the ITS2 (http://its2.bioapps.biozentrum.uni-wuerzburg.de). The development started with an optimization of length modelling topologies for Hidden Markov Models (HMMs), which were successfully applied on a secondary structure prediction model of the ITS2 marker. Here, structure is predicted by considering the sequences' composition in combination with the length distribution of different helical regions. Next, I integrated HMMs into the sequence-structure generation process for the delineation of the ITS2 within a given sequence. This re-implemented pipeline could more than double the number of structure predictions and reduce the runtime to a few days. Together with further optimizations of the homology modelling process I can now exhaustively predict secondary structures in several iterations. These modifications currently provide 380,000 annotated sequences including 288,000 structure predictions. To include these structures in the calculation of alignments and phylogenetic trees, I developed the R-package "treeforge". It generates sequence-structure alignments on up to four different coding alphabets. For the first time also structural bonds were considered in alignments, which required the estimation of new scoring matrices. Now, the reconstruction of Maximum Parsimony, Maximum Likelihood as well as Neighbour Joining trees on all four alphabets requires just a few lines of code. The package was used to resolve the controversial chlorophyceaen dataset and could be integrated into future versions of the ITS2 workbench. The platform is based on a modern, feature-rich Web 2.0 user interface equipped with the latest AJAX and Web-service technologies. It performs HMM-based sequence annotation, structure prediction by energy minimization or homology modelling, alignment calculation and tree reconstruction on a flexible data pool that repeats calculations according to data changes. Further, it provides sequence motif detection to control annotation and structure prediction and a sequence-structure based BLAST search, which facilitates the taxon sampling process. All features and the usage of the ITS2 workbench are explained in a video tutorial. However, the workbench bears some limitations regarding the size of datasets. This is caused mainly due to the immense computational power needed for such extensive calculations. To demonstrate the validity of the approach also for large-scale analyses, a fully automated reconstruction of the Chlorophyta (Green Algal) Tree of Life was performed. The successful application of the marker even on large datasets underlines the capabilities of ITS2 sequence-structure analysis and suggests its utilization on further datasets. The ITS2 workbench provides an excellent starting point for such endeavours. KW - Ribosomale RNA KW - Datenbank KW - Marker KW - Phylogenie KW - Evolution KW - Sequenz KW - Struktur KW - Hidden Markov Model KW - Evolution KW - ribosomal RNA KW - workbench KW - sequence-structure Y1 - 2012 U6 - http://nbn-resolving.de/urn/resolver.pl?urn:nbn:de:bvb:20-opus-73128 ER - TY - THES A1 - Förster, Frank T1 - Making the most of phylogeny: Unique adaptations in tardigrades and 216374 internal transcribed spacer 2 structures T1 - Einzigartige Anpassungen in Tardigraden und 216374 "internal transcribed spacer 2" Strukturen N2 - The phylum Tardigrada consists of about 1000 described species to date. The animals live in habitats within marine, freshwater and terrestrial ecosystems allover the world. Tardigrades are polyextremophiles. They are capable to resist extreme temperature, pressure or radiation. In the event of desiccation, tardigrades enter a so-called tun stage. The reason for their great tolerance capabilities against extreme environmental conditions is not discovered yet. Our Funcrypta project aims at finding answers to the question what mechanisms underlie these adaption capabilities particularly with regard to the species Milnesium tardigradum. The first part of this thesis describes the establishment of expressed sequence tags (ESTs) libraries for different stages of M. tardigradum. From proteomics data we bioinformatically identified 144 proteins with a known function and additionally 36 proteins which seemed to be specific for M. tardigradum. The generation of a comprehensive web-based database allows us to merge the proteome and transcriptome data. Therefore we created an annotation pipeline for the functional annotation of the protein and nucleotide sequences. Additionally, we clustered the obtained proteome dataset and identified some tardigrade-specific proteins (TSPs) which did not show homology to known proteins. Moreover, we examined the heat shock proteins of M. tardigradum and their different expression levels depending on the actual state of the animals. In further bioinformatical analyses of the whole data set, we discovered promising proteins and pathways which are described to be correlated with the stress tolerance, e.g. late embryogenesis abundant (LEA) proteins. Besides, we compared the tardigrades with nematodes, rotifers, yeast and man to identify shared and tardigrade specific stress pathways. An analysis of the 50 and 30 untranslated regions (UTRs) demonstrates a strong usage of stabilising motifs like the 15-lipoxygenase differentiation control element (15-LOX-DICE) but also reveals a lack of other common UTR motifs normally used, e.g. AU rich elements. The second part of this thesis focuses on the relatedness between several cryptic species within the tardigrade genus Paramacrobiotus. Therefore for the first time, we used the sequence-structure information of the internal transcribed spacer 2 (ITS2) as a phylogenetic marker in tardigrades. This allowed the description of three new species which were indistinguishable using morphological characters or common molecular markers like the 18S ribosomal ribonucleic acid (rRNA) or the Cytochrome c oxidase subunit I (COI). In a large in silico simulation study we also succeeded to show the benefit for the phylogenetic tree reconstruction by adding structure information to the ITS2 sequence. Next to the genus Paramacrobiotus we used the ITS2 to corroborate a monophyletic DO-group (Sphaeropleales) within the Chlorophyceae. Additionally we redesigned another comprehensive database—the ITS2 database resulting in a doubled number of sequence-structure pairs of the ITS2. In conclusion, this thesis shows the first insights (6 first author publications and 4 coauthor publications) into the reasons for the enormous adaption capabilities of tardigrades and offers a solution to the debate on the phylogenetic relatedness within the tardigrade genus Paramacrobiotus. N2 - Der Tierstamm Tardigrada besteht aus derzeitig etwa 1000 beschriebenen Arten. Die Tiere leben in Habitaten in marinen, limnischen und terrestrischen Ökosystemen auf der ganzen Welt. Tardigraden sind polyextremophil. Sie können extremer Temperatur, Druck oder Strahlung widerstehen. Beim Austrocknen bilden sie ein so genanntes Tönnchenstadium. Der Grund für die hohe Toleranz gegenüber extremen Umweltbedingungen ist bis jetzt nicht aufgeklärt worden. Unser Funcrypta Projekt versucht Antworten darauf zu finden, was die hinter dieser Anpassungsfähigkeit liegenden Mechanismen sind. Dabei steht die Art Milnesium tardigradum im Mittelpunkt. Der erste Teil dieser Arbeit beschreibt die Etablierung einer expressed sequence tags (ESTs) Bibliothek für verschiedene Stadien von M. tardigradum. Aus unseren Proteomansatz konnten wir bislang 144 Proteine bioinformatisch identifizieren, denen eine Funktion zugeordnet werden konnte. Darüber hinaus wurden 36 Proteine gefunden, welche spezifisch für M. tardigradum zu sein scheinen. Die Erstellung einer umfassenden internetbasierenden Datenbank erlaubt uns die Verknüpfung der Proteom und Transkriptomdaten. Dafür wurde eine Annotations-Pipeline erstellt um den Sequenzen Funktionen zuordnen zu können. Außerdem wurden die erhaltenen Proteindaten von uns geclustert. Dabei konnten wir einige Tardigraden-spezifische Proteine (tardigrade-specific protein, TSP) identifizieren die keinerlei Homologie zu bekannten Proteinen zeigen. Außerdem untersuchten wir die Hitze-Schock-Proteine von M. tardigradum und deren differenzielle Expression in Abhängigkeit vom Stadium der Tiere. In weiteren bioinformatischen Analysen konnten wir viel versprechende Proteine und Stoffwechselwege entdecken für die beschrieben ist, dass sie mit Stressreaktionen in Verbindung stehen, beispielsweise late embryogenesis abundant (LEA) Proteine. Des Weiteren verglichen wir Tardigraden mit Nematoden, Rotatorien, Hefe und dem Menschen, um gemeinsame und Tardigraden-spezifische Stoffwechselwege identifizieren zu können. Analysen der 50 und 30 untranslatierten Bereiche zeigen eine verstärkte Nutzung von stabilisierenden Motiven, wie dem 15-lipoxygenase differentiation control element (LEA). Im Gegensatz dazu werden häufig benutzte Motive, wie beispielsweise AU-reiche Bereiche, gar nicht gefunden. Der zweite Teil der Doktorarbeit beschäftigt sich mit den Verwandtschaftsverhältnissen einiger kryptischer Arten in der Tardigradengattung Paramacrobiotus. Hierfür haben wir, zum ersten Mal in Tardigraden, die Sequenz-Struktur-Informationen der internal transcribed spacer 2 Region als phylogenetischen Marker verwendet. Dies erlaubte uns die Beschreibung von drei neuen Arten, welche mit klassischen morphologischen Merkmalen oder anderen molekularen Markern wie 18S ribosomaler RNA oder Cytochrome c oxidase subunit I (COI) nicht unterschieden werden konnten. In einer umfangreichen in silico Simulationsstudie zeigten wir den Vorteil der bei der Rekonstruktion phylogenetischer Bäume unter der Hinzunahme der Strukturinformationen zur Sequenz der ITS2 entsteht. ITS2 Sequenz-Struktur-Informationen wurden außerdem auch dazu benutzt, eine monophyletische DO-Gruppe (Sphaeropleales) in den Chlorophyceae zu bestätigen. Zusätzlich haben wir eine umfassende Datenbank, die ITS2-Datenbank, überarbeitet. Dadurch konnten die Sequenz-Struktur-Informationen verdoppelt werden, die in dieser Datenbank verfügbar sind. Die vorliegende Doktorarbeit zeigt erste Einblicke (6 Erstautor- und 4 Koautor-Publikationen) in die Ursachen für die hervorragende Anpassungsfähigkeit der Tardigraden und beschreibt die erfolgreiche Aufklärung der Verwandtschaftsverhältnisse in der Tardigradengattung Paramacrobiotus. KW - Phylogenie KW - Bioinformatik KW - Würzburg / Universität / Lehrstuhl für Bioinformatik KW - Anpassung KW - Datenbank KW - ITS2 KW - Marker KW - Tardigraden KW - Bärtierchen KW - ITS2 KW - Marker KW - Tardigrades KW - Waterbear Y1 - 2010 U6 - http://nbn-resolving.de/urn/resolver.pl?urn:nbn:de:bvb:20-opus-51466 ER -