Assessing NER tools for dialogue data anonymization

Pereira, Miguel Alexandre da Silva Sarmento Falco

Please use this identifier to cite or link to this item: http://hdl.handle.net/10071/30399

Full metadata record

DC Field	Value	Language
dc.contributor.advisor	Batista, Fernando Manuel Marques	-
dc.contributor.advisor	Ribeiro, Ricardo Daniel Santos Faro Marques	-
dc.contributor.author	Pereira, Miguel Alexandre da Silva Sarmento Falco	-
dc.date.accessioned	2024-01-15T11:06:48Z	-
dc.date.available	2024-01-15T11:06:48Z	-
dc.date.issued	2023-12-12	-
dc.date.submitted	2023-10	-
dc.identifier.citation	Pereira, M. A. da S. S. F. (2023). Assessing NER tools for dialogue data anonymization [Dissertação de mestrado, Iscte - Instituto Universitário de Lisboa]. Repositório Iscte. http://hdl.handle.net/10071/30399	por
dc.identifier.uri	http://hdl.handle.net/10071/30399	-
dc.description.abstract	As the number of organizations processing sensitive data grows, so does the need for businesses to protect and ensure the privacy of their customers. However, the prevailing methods for protecting sensitive data often involve manual or semi-automatic procedures, which can be resource-intensive and error-prone. This dissertation addresses data anonymization by focusing on Named Entity Recognition (NER) models. Particularly, we investigate and compare various NER models for the Portuguese language to automatically and effectively anonymize unstructured data. The models SpaCy, STRING, WikiNEuRal and RoBERTta are used in the machine learning approach with the goal of identifying classes such as Person, Location, and Organization. On the other hand, the rule-based approach seeks to identify classifications such as NIF, Email, Car Plate and even Postal Code. Additionally, it was created a Flask API tool capable of processing unstructured data and anonymizing it, more specifically, given a string that simulates a message, automatically anonymize the message content that might be considered as sensitive. This tool combines many techniques for identifying and extracting mentioned entities for the Portuguese language, based on rule models and machine learning. The combination of both rule-based and machine learning models in the same tool was crucial to enable the ability to encompass more sensitive classes for anonymization. The results calculated for the extraction of entities from the tool built in this work encompasses the results for the three classes calculated with the SpaCy model, with the addition of the results calculated for the rule-models created.	por
dc.description.abstract	Com o aumento do número de organizações que processam dados sensíveis, aumenta também a necessidade de as empresas assegurarem a privacidade dos seus clientes. No entanto, os métodos de segurança e proteção de dados sensíveis envolvem, frequentemente, procedimentos manuais ou semi-automáticos, os quais consomem muitos recursos e são propensos a erros. Esta tese aborda anonimização de dados, centrando-se em modelos de Reconhecimento de Entidades Mencionadas. Em particular, investigamos e comparamos vários modelos de Reconhecimento de Entidades Mencionadas para a língua portuguesa para anonimizar automaticamente dados não estruturados. Na abordagem de aprendizagem automática foram utilizados os modelos do SpaCy, STRING, WikiNEuRal e RoBERTta com o intuito de identificar classes como Pessoa, Localização e Organização. Contudo, a abordagem baseada em regras procura identificar classes como NIF, Email, Matrícula de carro e até mesmo Código Postal. Consequentemente, foi construída uma ferramenta em Flask, capaz de processar dados não estruturados e anonimizá-los, mais especificamente, capaz de, dada uma string (que simule uma mensagem), anonimizar o seu conteúdo sensível automaticamente. Esta ferramenta combina diferentes técnicas para a Identificação e Extração de Entidades Mencionadas para a língua portuguesa, baseando-se em modelos de regras e de aprendizagem automática. A junção de ambos os modelos de regras e aprendizagem automática na mesma ferramenta foi essencial para conseguirmos abranger mais classes sensíveis para anonimização, sendo que os resultados calculados para a extração de entidades da ferramenta contruída neste trabalho, engloba os resultados para as três classes calculadas com o modelo SpaCy, com a adição dos modelos de regras criados.	por
dc.language.iso	eng	por
dc.rights	openAccess	por
dc.subject	Data anonymization	por
dc.subject	Entities extraction	por
dc.subject	Processamento de linguagem natural - -- NLP Natural language processing	por
dc.subject	Artificial	por
dc.subject	Named entity recognition	por
dc.subject	Sensitive data	por
dc.subject	Anonimização de dados	por
dc.subject	Extração de entidades	por
dc.subject	Reconhecimento de entidades mencionadas	por
dc.subject	Dados sensíveis	por
dc.title	Assessing NER tools for dialogue data anonymization	por
dc.type	masterThesis	por
dc.peerreviewed	yes	por
dc.identifier.tid	203446488	por
dc.subject.fos	Domínio/Área Científica::Engenharia e Tecnologia::Engenharia Eletrotécnica, Eletrónica e Informática	por
thesis.degree.name	Mestrado em Engenharia Informática	por
iscte.subject.ods	Trabalho digno e crescimento económico	por
iscte.subject.ods	Indústria, inovação e infraestruturas	por
iscte.subject.ods	Reduzir as desigualdades	por
thesis.degree.department	Departamento de Ciências e Tecnologias da Informação	por
Appears in Collections:	T&D-DM - Dissertações de mestrado

Files in This Item:

File	Description	Size	Format
master_miguel_falco_pereira.pdf		484,4 kB	Adobe PDF	View/Open

Show simple item record