
Mostrar el registro sencillo del ítem
| dc.contributor.advisor | Zazo Rodríguez, Ángel Francisco | es_ES |
| dc.contributor.author | Uribe Esquivel, Diego | |
| dc.date.accessioned | 2026-08-26T07:56:16Z | |
| dc.date.available | 2026-08-26T07:56:16Z | |
| dc.date.issued | 2025-07 | |
| dc.identifier.uri | http://hdl.handle.net/10366/172541 | |
| dc.description | Trabajo Fin de Máster. Máster universitario en Sistemas Inteligentes. | es_ES |
| dc.description.abstract | [ES]Este trabajo explora diversas técnicas para implementar la desambiguación de nombres de autor (AND) en bases de datos bibliográficas antiguas con metadatos limitados. Se investigan distintos métodos que hayan sido usados. Se investigaron métodos de similitud sintáctica, como Levenshtein y Jaro-Winkler, técnicas de minería de texto; por ontologías, similitud sintáctica como TF-IDF, Word Embeddings como Word2Vec, BERT y embeddings con LLMs), enfoques de minería de datos abarcando algoritmos de Machine Learning supervisados, no supervisados y combinaciones (semi-supervisados). Así mismo, se abarcaron algunas técnicas de Deep Learning e incrustaciones de redes (Network Embeddings). La implementación del proyecto combina 3 métodos principales, la similitud de texto para nombres de autores, el Word Embedding de títulos, usando el LLM "nomic 2 la comparación por medio de la similitud del coseno, junto con redes de coautoría. Así mismo, se emplean herramientas como Apache Solr y ChromaDB para una gestión y recuperación eficiente de los datos. | es_ES |
| dc.description.abstract | [EN]This work explores various techniques for implementing Author Name Disambiguation (AND) in old bibliographic databases with limited metadata. Different methods that have been previously used were investigated. Syntactic similarity methods, such as Levenshtein and Jaro-Winkler, were researched, as were text mining techniques including ontology-based methods, syntactic similarity like TF-IDF, Word Embeddings (such as Word2Vec, BERT, and embeddings with LLMs), and data mining approaches covering supervised, unsupervised, and combined (semisupervised) Machine Learning algorithms. Additionally, some Deep Learning techniques and Network Embeddings were covered. The project’s implementation combines three main methods: text similarity for author names, Word Embedding of titles using the "nomic"LLM and comparison via cosine similarity, along with coauthorship networks. Furthermore, tools like Apache Solr and ChromaDB are employed for efficient data management and retrieval. | |
| dc.language.iso | spa | es_ES |
| dc.rights | Attribution 4.0 International | es_ES |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/4.0/ | es_ES |
| dc.subject | Desambiguación de nombres de autor | es_ES |
| dc.subject | Metadatos limitados | es_ES |
| dc.subject | Supervisados y no supervisados | es_ES |
| dc.subject | Machine Learning | es_ES |
| dc.subject | Word Embeddings | es_ES |
| dc.subject | Network Embeddings | es_ES |
| dc.subject | LLMs | es_ES |
| dc.title | Desambiguación de nombres de autor en bases de datos bibliográficas de pocos metadatos | es_ES |
| dc.type | info:eu-repo/semantics/masterThesis | es_ES |
| dc.rights.accessRights | info:eu-repo/semantics/openAccess | es_ES |








