Tese de Doutorado

Documento
Tese de Doutorado
Nome completo
Ilyas Philippe Abdelkader Jacques Grandguillaume
E-mail
Unidade da USP
Interunidades em Bioinformática
Programa ou Especialidade
Data de Defesa
2025-12-08
Imprenta
São Paulo, 2025
Banca examinadora
Silva, Fernando Luis Barroso da (Presidente)
Andreani, Jessica
Lima, Fernando Rodrigues de
Teixeira, André Azevedo Reis
Título em inglês
Computational study of the antibody-antigen properties to develop binders for viral proteins
Palavras-chave em inglês
Antibody-antigen interactions; Glycosylation; Machine learning; Molecular docking; Nanobodies; NS1 protein; pH-dependence; Scoring function; Structural databases; Zika virus
Resumo em inglês
Understanding and predicting antibody-antigen interactions represents a major challenge for the development of therapies and vaccines. However, current approaches often neglect critical structural and physicochemical features that govern these interactions in a physiological context. This thesis addresses this issue through three complementary axes. The first axis concerns the creation of ANABAG, an enriched database of antibody-antigen complexes offering a novel level of annotation in the field. Unlike existing resources, ANABAG systematically integrates biologically relevant features including glycosylation detection and pH-dependent electrostatic properties. An innovative curation strategy combining sequential and structural criteria preserves complexes with highly similar sequences presenting distinct binding modes. The analysis reveals that a significant proportion of structures were resolved under non-physiological pH conditions, with substantial impacts on the electrostatic properties of interfaces. The study of complex diversity identifies polyspecific antibodies capable of recognizing highly distinct antigens while maintaining remarkably similar paratope composition, and convergent epitopes, exhibiting similar properties and being targeted by distinct paratopes. The second axis develops ARID-sf, a machine learning-based scoring function specifically designed to rank antibody-antigen docking poses. ARID-sf integrates multi-scale descriptors combining evolutionary information, decomposed potential energies, amino acid residue contact maps, and voxel grid geometric representations. Evaluations show that ARID-sf outperforms physics-based functions in identifying near-native poses, with particularly marked improvements on large sets of complexes produced by other research teams. Generalization analysis reveals consistent performance regardless of sequence identity with training data, suggesting that the model captures generalizable physicochemical principles. Contribution studies show that this improvement stems from the ability to contextualize local energetic interactions rather than treating them as absolute penalties. Finally, tests conducted on another dataset demonstrate the limitations of scoring functions when the starting antigen and antibody structures exhibit significant structural deviations from the complexed forms. The third axis applies these tools to the flavivirus NS1 system. Molecular dynamics simulations comparing Ugandan and Brazilian Zika virus strains reveal that dynamic specificities between strains persist independently of glycosylation. An integrative protocol combining docking, ARID-sf, structural refinement, and free energy calculations was applied to reproduce experimental nanobody binding data. The results demonstrate a remarkable ability to predict strain specificity, with all scores correctly distinguishing ZIKV-nanobody pairs from Dengue-nanobody pairs. However, the relative affinity ranking among nanobodies remains partially discordant with experimental observations, highlighting the importance of explicitly integrating glycosylations and conformational flexibility into predictive protocols. This thesis establishes new resources and methods for modeling antibody-antigen interactions while revealing important biological features and current limitations requiring future developments.
Título em português
Estudo computacional das propriedades anticorpo-antígeno para desenvolver ligantes imunológicos para proteínas virais
Palavras-chave em português
Ancoragem molecular; Aprendizado de máquina; Bancos de dados estruturais; Dependência de pH; Função de pontuação; Glicosilação; Interações anticorpo-antígeno; Nanocorpos; Proteína NS1; Vírus Zika
Resumo em português
A compreensão e predição das interações anticorpo-antígeno representam um desafio importante para o desenvolvimento de terapias e vacinas. Entretanto, as abordagens atuais frequentemente negligenciam características estruturais e físico-químicas críticas que governam essas interações em um contexto fisiológico. Esta tese aborda essa problemática através de três eixos complementares. O primeiro eixo diz respeito à criação do ANABAG, um banco de dados enriquecido de complexos anticorpo-antígeno oferecendo um novo nível de anotação na área. Diferentemente dos recursos existentes, o ANABAG integra sistematicamente características biologicamente relevantes incluindo a detecção de glicosilações e as propriedades eletrostáticas dependentes do pH. Uma estratégia inovadora de curadoria combinando critérios sequenciais e estruturais preserva complexos com sequências altamente similares apresentando modos de ligação distintos. A análise revela que uma proporção significativa das estruturas foi resolvida em condições de pH não fisiológicas, com impactos substanciais nas propriedades eletrostáticas das interfaces. O estudo da diversidade dos complexos identifica anticorpos poliespecíficos capazes de reconhecer antígenos muito distintos mantendo uma composição de parátopo notavelmente similar, e epítopos convergentes, apresentando propriedades similares e sendo alvos de parátopos distintos. No segundo eixo, desenvolvemos o ARID-sf, uma função de pontuação baseada em aprendizado de máquina especificamente projetada para classificar conformações (“poses”) resultantes do acoplamento molecular (“docking”) entre anticorpos e antígenos. O ARID-sf integra descritores multi-escala, combinando informações evolutivas, energias potenciais decompostas, mapas de contatos de resíduos de aminoácidos e representações geométricas em grade de “voxels” (píxeis volumétricos). As avaliações mostram que o ARID-sf supera funções baseadas em física para identificar conformações quase-nativas, com melhorias particularmente marcantes em grandes conjuntos de complexos produzidos por outros grupos de pesquisa. A análise de generalização revela desempenho consistente independentemente da identidade de sequência com os dados de treinamento, sugerindo que o modelo captura princípios físico-químicos generalizáveis. Os estudos de contribuição mostram que essa melhoria provém da capacidade de contextualizar as interações energéticas locais ao invés de tratá-las como penalidades absolutas. Finalmente, os testes realizados em outro conjunto de dados demonstram as limitações das funções de pontuação quando as estruturas iniciais do antígeno e anticorpo apresentam desvios estruturais importantes em relação às formas complexadas. O terceiro eixo aplica essas ferramentas a proteínas NS1 dos flavivírus. Simulações de dinâmica molecular comparando as cepas ugandense e brasileira do vírus Zika revelam que as especificidades dinâmicas entre cepas persistem independentemente da glicosilação. Um protocolo integrativo combinando “docking”, ARID-sf, refinamento estrutural e cálculos de energia livre foi aplicado para reproduzir dados experimentais de ligação de nanocorpos. Os resultados demonstram uma capacidade notável de prever a especificidade de cepa, com todas as pontuações distinguindo corretamente os pares ZIKV-nanocorpo dos pares Dengue-nanocorpo. Entretanto, a classificação de afinidade relativa entre nanocorpos permanece parcialmente discordante com as observações experimentais, destacando a importância de integrar explicitamente as glicosilações e a flexibilidade conformacional nos protocolos preditivos. Esta tese estabelece novos recursos e métodos para a modelagem das interações anticorpo-antígeno enquanto revela características biológicas importantes e as limitações atuais que requerem desenvolvimentos futuros.

AVISO - A consulta a este documento fica condicionada na aceitação das seguintes condições de uso: Este trabalho é somente para uso privado de atividades de pesquisa e ensino. Não é autorizada sua reprodução para quaisquer fins lucrativos. Esta reserva de direitos abrange a todos os dados do documento bem como seu conteúdo. Na utilização ou citação de partes do documento é obrigatório mencionar nome da pessoa autora do trabalho.

Data de Publicação
2026-01-22

Trabalhos decorrentes

AVISO: Saiba o que são os trabalhos decorrentes clicando aqui.

Serviços

Carregando...