
Compartir
Título
Clasificación de escenas en ambientes interiores para navegación de robots utilizando inteligencia artificial
Autor(es)
Director(es)
Palabras clave
Tesis y disertaciones académicas
Universidad de Salamanca (España)
Tesis Doctoral
Academic dissertations
Reconocimiento de escena
Codificación de características de parche
Detección de región discriminativa
Redes neuronales convolucionales
Aprendizaje profundo
Scene Recognition
Patch Feature Encoding
Discriminative region detection
Convolutional neural networks
Deep learning
Clasificación UNESCO
3304.11 Diseño de Sistemas de Cálculo
1203.04 Inteligencia Artificial
Fecha de publicación
2026
Resumen
[ES] Entender el contexto de una escena a partir de la información percibida visualmente
de la misma manera que un humano lo haría, se vuelve fundamental en las acciones
colaborativas de los robots en muchas tareas cotidianas. Cuando un robot realiza esta
acción, es de alto grado de dificultad ya que requiere el reconocimiento de la escena a
partir de un análisis del contexto de los objetos que la conforman. El conocimiento no
se limita a la descripción de las características visibles del contexto, sino que también
implica la capacidad de razonar sobre las relaciones existentes entre los diferentes objetos
de una escena y su importancia semántica, lo que proporciona un sentido lógico al proceso
de reconocimiento. El reconocimiento de escenas se utiliza en aplicaciones relacionadas
con la visión por computadora, incluida la recuperación de información, la robótica, la
monitorización en tiempo real y la clasificación de eventos. En los enfoques tradicionales
de aprendizaje automático, las funciones se definen y extraen manualmente o mediante
métodos de selección de funciones, mientras que en los modelos de aprendizaje profundo,
las características se aprenden y extraen automáticamente, logrando una mayor precisión
y rendimiento. Aunque en las tareas de reconocimiento de escenas, las arquitecturas de
aprendizaje profundo han tenido un rendimiento aceptable, este sigue siendo un problema
sin resolver en su totalidad. Los algoritmos deep learning tienen dificultades para aprender
conceptos abstractos, no realizan una interpretación profunda de los contenidos, no
capturan relaciones causales, y requieren grandes volúmenes de datos para alcanzar un
desempeño aceptable en escenarios específicos. Para superar las debilidades existentes, se
puede incluir información semántica que relacione los objetos en una escena para el proceso
de auto localización de robots, permitiendo de este modo contar con una herramienta
adicional en la interacción con su entorno. En esta propuesta se plantea un modelo para
el reconocimiento de escenas interiores que mejora la interacción entre robots, su entorno
y las personas mediante el uso de información semántica. El método se basa en el análisis
del contexto de objetos en imágenes, seleccionando regiones discriminantes y aplicando
técnicas de extracción de características que maximizan la información relevante. A través
de mecanismos de atención, se generan mapas de prominencia para identificar objetos clave
que contribuyen al reconocimiento eficiente de escenas. La representación final combina
características locales y globales, construidas en arquitecturas genéricas de extracción de
características. [EN] Understanding the context of a scene from visually perceived information in a manner akin
to human perception is fundamental to enabling collaborative robot behaviors in many
everyday tasks. However, when a robot attempts to perform this process, it becomes highly
challenging, as it requires scene recognition grounded in an analysis of the contextual
arrangement of the objects that constitute the environment. Such knowledge is not limited
to describing the visible characteristics of the scene; rather, it also entails the ability to
reason about the relationships among the different objects and their semantic relevance,
thereby providing a coherent and logical basis for the recognition process. Scene recognition
is employed in a wide range of computer vision applications, including information retrieval,
robotics, real-time monitoring, and event classification. In traditional machine learning
approaches, features are defined and extracted manually or through feature selection
methods, whereas in deep learning models, representations are learned and extracted
automatically, often yielding higher accuracy and better overall performance. Although
deep learning architectures have achieved acceptable results in scene recognition tasks, the
problem remains far from being fully solved. In particular, deep learning algorithms struggle
to acquire abstract concepts, do not attain a deep conceptual interpretation of content,
fail to capture causal relationships, and require large volumes of data to reach satisfactory
performance in specific scenarios. To address these limitations, semantic information
that links objects within a scene can be incorporated into the robot self-localization
process, thereby providing an additional source of information for interaction with the
environment. In this context, this work proposes a model for indoor scene recognition that
enhances the interaction between robots, their surroundings, and humans through the use
of semantic information. The method relies on analyzing object context in images, selecting
discriminative regions, and applying feature extraction techniques that maximize relevant
information. By means of attention mechanisms, saliency maps are generated to identify
key objects that contribute to efficient scene recognition. The final representation integrates
local and global features constructed using generic feature-extraction architectures.
URI
DOI
10.14201/gredos.172392
Aparece en las colecciones













