Development and application of a new computational approach for prediction of amyloidogenicity in proteins
Development and application of a new computational approach for prediction of amyloidogenicity in proteins
Where did the research take place?
The study site has not been established. Author addresses may differ from where the research occurred.
A plain-language reading has not been prepared for this paper yet.
Original abstract
Développement et application d'une nouvelle approche computationnelle de prédiction de l'amyloïdogénicité des séquences protéiques Les protéines sont des macromolécules à la base de la constitution du monde vivant. Certaines régions des protéines ont la capacité de s'agréger et de former des fibrilles. Ces régions sont appelées "amyloïdes" et sont corrélées à l'apparition de maladies et de neuropathologies liées à l'âge. On peut citer parmi les plus connues : la maladie d'Alzheimer, la maladie de Huntington, la maladie de Parkinson ou encore le diabète de type II. Sachant que l'espérance de vie augmente, il est certain que la prévalence de ces maladies liées à l'âge augmentera dans les années à venir. Les progrès technologiques récents ont conduit à la publication de nombreuses séquences, structures et fonctions de protéines. Cette explosion de données a conduit à l'émergence de nombreuses ressources et outils bioinformatiques, notamment pour la prédiction et l'analyse des régions amyloïdogéniques.C'est dans ce contexte que nous avons développé TAPASS (Tool for Annotation of Protein Amyloidogenicity in the context of other Structural States), un outil de prédiction des régions amyloïdogéniques dans les séquences protéiques, ainsi que de divers autres états structuraux. Ce pipeline comprend dix programmes de prédiction de différents états structuraux des protéines : régions amyloïdogéniques, régions structurées, régions non structurées, régions transmembranaires, peptides signaux et SLiMs (Short Linear Motifs). Il nous permet de détecter efficacement les régions amyloïdogéniques potentielles dans le contexte structurel de la protéine. TAPASS est librement accessible à tous les utilisateurs via une interface web. Grâce à sa vitesse d'exécution, son utilisation sur de grands jeux de données pour la méta-analyse est également possible.Dans un second temps, cette thèse s'est focalisée sur l'étude fondamentale de l'amyloïdogénicité des protéines. Pour ce faire, nous construisons une base de données à partir des résultats d'exécution de TAPASS sur 76 protéomes de référence représentant la diversité des trois règnes du vivant (archées, bactéries et eucaryotes). La base de données nous a permis d'étudier les régions amyloïdogéniques (RA) au sein des régions non structurées, également appelées régions amyloïdogéniques exposées (RAE), présentant un potentiel d'agrégation plus élevé. Cela nous a permis d'établir plusieurs nouvelles corrélations sur l'amyloïdogénicité de différentes espèces. Nous avons constaté que les procaryotes ont une proportion plus élevée de protéines contenant des RAs, tandis que les eucaryotes ont plus de protéines contenant des RAEs. Les procaryotes thermophiles, espèces vivant dans des environnements à haute température, ont moins de RAs et de RAEs que les procaryotes mésophiles. Nous avons également établi que les protéines contenant des RAEs sont préférentiellement localisées dans le noyau des cellules eucaryotes, mais ont tendance à être davantage sécrétées chez les procaryotes. De plus, plus la longueur des protéines augmente, moins celles-ci contiennent de RAs, mais cette diminution n'est pas observée avec les RAEs. Nous avons observé un enrichissement significatif en SliMs au sein des protéines contenant des RAEs par rapport aux protéines intrinsèquement désordonnées sans RAEs. Enfin, les protéines à forte abondance ont moins de RAEs par rapport aux protéines à faible abondance. Notre analyse a également montré que les protéines essentielles ont moins de RAEs par rapport aux protéines non essentielles.Cette thèse a également contribué au développement d'AmyloComp. Ce programme est capable de prédire la co-agrégation entre deux régions amyloïdogéniques différentes. Il est basé sur la détection des B-arches à l'aide de la version améliorée d'ArchCandy 2.0.