
Compartir
Título
Desambiguación de nombres de autor en bases de datos bibliográficas de pocos metadatos
Autor(es)
Director(es)
Palabras clave
Desambiguación de nombres de autor
Metadatos limitados
Supervisados y no supervisados
Machine Learning
Word Embeddings
Network Embeddings
LLMs
Fecha de publicación
2025-07
Resumen
[ES]Este trabajo explora diversas técnicas para implementar la desambiguación de
nombres de autor (AND) en bases de datos bibliográficas antiguas con metadatos
limitados. Se investigan distintos métodos que hayan sido usados. Se investigaron
métodos de similitud sintáctica, como Levenshtein y Jaro-Winkler, técnicas de minería
de texto; por ontologías, similitud sintáctica como TF-IDF, Word Embeddings
como Word2Vec, BERT y embeddings con LLMs), enfoques de minería de datos
abarcando algoritmos de Machine Learning supervisados, no supervisados y combinaciones
(semi-supervisados). Así mismo, se abarcaron algunas técnicas de Deep
Learning e incrustaciones de redes (Network Embeddings). La implementación del
proyecto combina 3 métodos principales, la similitud de texto para nombres de autores,
el Word Embedding de títulos, usando el LLM "nomic 2 la comparación por
medio de la similitud del coseno, junto con redes de coautoría. Así mismo, se emplean
herramientas como Apache Solr y ChromaDB para una gestión y recuperación
eficiente de los datos. [EN]This work explores various techniques for implementing Author Name Disambiguation
(AND) in old bibliographic databases with limited metadata. Different
methods that have been previously used were investigated. Syntactic similarity
methods, such as Levenshtein and Jaro-Winkler, were researched, as were text mining
techniques including ontology-based methods, syntactic similarity like TF-IDF,
Word Embeddings (such as Word2Vec, BERT, and embeddings with LLMs), and
data mining approaches covering supervised, unsupervised, and combined (semisupervised)
Machine Learning algorithms. Additionally, some Deep Learning techniques
and Network Embeddings were covered. The project’s implementation combines
three main methods: text similarity for author names, Word Embedding of
titles using the "nomic"LLM and comparison via cosine similarity, along with coauthorship
networks. Furthermore, tools like Apache Solr and ChromaDB are employed
for efficient data management and retrieval.
Descripción
Trabajo Fin de Máster. Máster universitario en Sistemas Inteligentes.
URI
Aparece en las colecciones













