Mostrar el registro sencillo del ítem

dc.contributor.advisorZazo Rodríguez, Ángel Francisco es_ES
dc.contributor.authorUribe Esquivel, Diego
dc.date.accessioned2026-08-26T07:56:16Z
dc.date.available2026-08-26T07:56:16Z
dc.date.issued2025-07
dc.identifier.urihttp://hdl.handle.net/10366/172541
dc.descriptionTrabajo Fin de Máster. Máster universitario en Sistemas Inteligentes.es_ES
dc.description.abstract[ES]Este trabajo explora diversas técnicas para implementar la desambiguación de nombres de autor (AND) en bases de datos bibliográficas antiguas con metadatos limitados. Se investigan distintos métodos que hayan sido usados. Se investigaron métodos de similitud sintáctica, como Levenshtein y Jaro-Winkler, técnicas de minería de texto; por ontologías, similitud sintáctica como TF-IDF, Word Embeddings como Word2Vec, BERT y embeddings con LLMs), enfoques de minería de datos abarcando algoritmos de Machine Learning supervisados, no supervisados y combinaciones (semi-supervisados). Así mismo, se abarcaron algunas técnicas de Deep Learning e incrustaciones de redes (Network Embeddings). La implementación del proyecto combina 3 métodos principales, la similitud de texto para nombres de autores, el Word Embedding de títulos, usando el LLM "nomic 2 la comparación por medio de la similitud del coseno, junto con redes de coautoría. Así mismo, se emplean herramientas como Apache Solr y ChromaDB para una gestión y recuperación eficiente de los datos.es_ES
dc.description.abstract[EN]This work explores various techniques for implementing Author Name Disambiguation (AND) in old bibliographic databases with limited metadata. Different methods that have been previously used were investigated. Syntactic similarity methods, such as Levenshtein and Jaro-Winkler, were researched, as were text mining techniques including ontology-based methods, syntactic similarity like TF-IDF, Word Embeddings (such as Word2Vec, BERT, and embeddings with LLMs), and data mining approaches covering supervised, unsupervised, and combined (semisupervised) Machine Learning algorithms. Additionally, some Deep Learning techniques and Network Embeddings were covered. The project’s implementation combines three main methods: text similarity for author names, Word Embedding of titles using the "nomic"LLM and comparison via cosine similarity, along with coauthorship networks. Furthermore, tools like Apache Solr and ChromaDB are employed for efficient data management and retrieval.
dc.language.isospaes_ES
dc.rightsAttribution 4.0 Internationales_ES
dc.rights.urihttp://creativecommons.org/licenses/by-nc-nd/4.0/es_ES
dc.subjectDesambiguación de nombres de autores_ES
dc.subjectMetadatos limitadoses_ES
dc.subjectSupervisados y no supervisadoses_ES
dc.subjectMachine Learninges_ES
dc.subjectWord Embeddingses_ES
dc.subjectNetwork Embeddingses_ES
dc.subjectLLMses_ES
dc.titleDesambiguación de nombres de autor en bases de datos bibliográficas de pocos metadatoses_ES
dc.typeinfo:eu-repo/semantics/masterThesises_ES
dc.rights.accessRightsinfo:eu-repo/semantics/openAccesses_ES


Ficheros en el ítem

Thumbnail

Este ítem aparece en la(s) siguiente(s) colección(ones)

Mostrar el registro sencillo del ítem

Attribution 4.0 International
Excepto si se señala otra cosa, la licencia del ítem se describe como Attribution 4.0 International