| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 4.28 MB | Adobe PDF |
Autores
Resumo(s)
Federated Learning (FL) has established itself as a leading paradigm for collaborative machine
learning, allowing participants to train models collectively without sharing their private data.
Despite its privacy-preserving design, the periodic exchange of model updates leaves these
systems vulnerable to information leakage. Notable threats include Membership Inference
Attacks (MIA), which exploit model overfitting to determine if specific data samples were
used during training, and Gradient Inversion Attacks (GIA), which attempt to reconstruct the
exact training images from shared gradients. While existing literature has proposed various
active defenses and investigated privacy risks within star and mesh network topologies, a
systematic evaluation of how attack effectiveness evolves across training rounds over a
diverse spectrum of network topologies remains a critical research gap.
This dissertation presents a comprehensive empirical analysis of how different network
topologies influence data privacy in centralized and decentralized FL systems over time.
By isolating the network topology as the primary variable, we evaluate the vulnerability
of six distinct topologies, star, tree, line, ring, full mesh, and partial mesh, against three
MIA variants and a GIA. The experiments were conducted using the MNIST and CIFAR10
datasets under both Independent and Identically Distributed and Non-Independent and
Identically Distributed (Non-IID) data distributions to capture the temporal evolution of
these attacks across the training rounds.
Our findings show that network topologies fundamentally dictate the severity and localization
of privacy leakage. For instance, intermediate aggregation in the tree topology acts as a
native privacy shield, effectively hiding memorized features from a central root node, though
it inadvertently shifts the primary risk to intermediate edge nodes. Furthermore, the analysis
reveals that extreme data heterogeneity (Non-IID) significantly aggravates vulnerabilities
across all topologies, heavily increasing MIA and GIA success rates on complex visual tasks.
Moreover, the results establish that restricting an adversary’s awareness of the broader
network topology severely impedes their ability to accurately execute GIA, as successful data
reconstruction depends heavily on precise knowledge of the aggregation phase in federated
systems. Ultimately, this research highlights that network topology can be strategically
leveraged as passive defense mechanisms.
O Federated Learning (FL) é um paradigma de referência para a aprendizagem colaborativa, permitindo que os participantes treinem modelos de machine learning em conjunto sem partilharem os seus dados privados. Apesar da sua premissa orientada para preservação de privacidade, a troca regular de atualizações dos modelos faz com que este tipo de sistemas sejam vulneráveis a fugas de dados. Ameaças importantes incluem os Membership Inference Attacks (MIA), que exploram o overfitting do modelo para determinar se amostras de dados específicas foram utilizadas durante o treino, e os Gradient Inversion Attacks (GIA), que tentam reconstruir as imagens exatas usadas no treino a partir dos gradientes partilhados. Embora a literatura existente tenha proposto vários mecanismos de defesa e investigado os riscos de privacidade em topologias de estrela e malha, uma avaliação sistemática de como a eficácia destes ataques evolui ao longo de todo o ciclo de treino, em diferentes topologias de rede, continua a ser uma lacuna na investigação. Esta dissertação apresenta uma análise empírica abrangente sobre o modo como diferentes topologias de rede influenciam a privacidade dos dados em sistemas de FL ao longo do tempo. Ao isolar o grafo da rede como variável principal, avaliamos a vulnerabilidade de seis topologias de rede distintas, estrela, árvore, linha, anel, malha completa e malha parcial, contra três variantes de MIA e um GIA avançado. As experiências foram conduzidas utilizando os conjuntos de dados MNIST e CIFAR10, sob distribuições de dados Independent and Identically Distributed e Non-Independent and Identically Distributed (Non-IID), com o objetivo de capturar a evolução temporal destes ataques ao longo das rondas de treino. Os resultados obtidos mostram que as propriedades estruturais fundamentalmente definem a gravidade e a localização da fuga de privacidade. Por exemplo, a agregação intermédia em topologias em árvore atua como um escudo de privacidade nativo, ocultando eficazmente as características memorizadas de um servidor central raiz, embora transfira inadvertidamente o risco principal para os nós intermédios. Além disso, a análise revela que a extrema heterogeneidade dos dados (Non-IID) agrava significativamente as vulnerabilidades em todas as topologias, aumentando fortemente as taxas de sucesso dos MIA e GIA em tarefas visuais complexas. Os resultados sugerem ainda que ao restringir o conhecimento do adversário sobre a topologia global da rede se impede a sua capacidade de executar GIA com precisão, uma vez que a reconstrução bem sucedida dos dados depende fortemente do conhecimento exato dos caminhos de agregação. Em última análise, esta investigação destaca que a topologia da rede pode ser estrategicamente usada como mecanismos de defesa passivos.
O Federated Learning (FL) é um paradigma de referência para a aprendizagem colaborativa, permitindo que os participantes treinem modelos de machine learning em conjunto sem partilharem os seus dados privados. Apesar da sua premissa orientada para preservação de privacidade, a troca regular de atualizações dos modelos faz com que este tipo de sistemas sejam vulneráveis a fugas de dados. Ameaças importantes incluem os Membership Inference Attacks (MIA), que exploram o overfitting do modelo para determinar se amostras de dados específicas foram utilizadas durante o treino, e os Gradient Inversion Attacks (GIA), que tentam reconstruir as imagens exatas usadas no treino a partir dos gradientes partilhados. Embora a literatura existente tenha proposto vários mecanismos de defesa e investigado os riscos de privacidade em topologias de estrela e malha, uma avaliação sistemática de como a eficácia destes ataques evolui ao longo de todo o ciclo de treino, em diferentes topologias de rede, continua a ser uma lacuna na investigação. Esta dissertação apresenta uma análise empírica abrangente sobre o modo como diferentes topologias de rede influenciam a privacidade dos dados em sistemas de FL ao longo do tempo. Ao isolar o grafo da rede como variável principal, avaliamos a vulnerabilidade de seis topologias de rede distintas, estrela, árvore, linha, anel, malha completa e malha parcial, contra três variantes de MIA e um GIA avançado. As experiências foram conduzidas utilizando os conjuntos de dados MNIST e CIFAR10, sob distribuições de dados Independent and Identically Distributed e Non-Independent and Identically Distributed (Non-IID), com o objetivo de capturar a evolução temporal destes ataques ao longo das rondas de treino. Os resultados obtidos mostram que as propriedades estruturais fundamentalmente definem a gravidade e a localização da fuga de privacidade. Por exemplo, a agregação intermédia em topologias em árvore atua como um escudo de privacidade nativo, ocultando eficazmente as características memorizadas de um servidor central raiz, embora transfira inadvertidamente o risco principal para os nós intermédios. Além disso, a análise revela que a extrema heterogeneidade dos dados (Non-IID) agrava significativamente as vulnerabilidades em todas as topologias, aumentando fortemente as taxas de sucesso dos MIA e GIA em tarefas visuais complexas. Os resultados sugerem ainda que ao restringir o conhecimento do adversário sobre a topologia global da rede se impede a sua capacidade de executar GIA com precisão, uma vez que a reconstrução bem sucedida dos dados depende fortemente do conhecimento exato dos caminhos de agregação. Em última análise, esta investigação destaca que a topologia da rede pode ser estrategicamente usada como mecanismos de defesa passivos.
Descrição
Palavras-chave
Collaborative Machine Learning Federated Learning Privacy Topology Membership Inference Attack Gradient Inversion Attack
