Debido a labores de actualización y migración del repositorio a una versión más reciente, el sistema permanecerá disponible únicamente para consulta hasta nuevo aviso. Agradecemos su comprensión.
Compartir
Título
Visión e inteligencia artificial. Comparativa de modelos en detección de violencia
Autor(es)
Director(es)
Palabras clave
Detección de Violencia
Visión Artificial
Aprendizaje Profundo
Redes Neuronales Convolucionales
Violence Detection
Artificial Vision
Deep Learning
Convolutional Neural Networks
ViViT
Clasificación UNESCO
1203.04 Inteligencia Artificial
Fecha de publicación
2025-07
Resumen
[ES]La detección automática de violencia en video mediante Visión e Inteligencia Artificial
es un desafío que exige un equilibrio entre rendimiento, eficiencia y robustez.
Este Trabajo de Fin de Máster realiza un estudio comparativo de cuatro arquitecturas
de aprendizaje profundo seleccionadas por representar diferentes filosofías en
el reconocimiento de acciones en video, cada una con características particulares:
I3D, SlowFast, TSM y ViViT. Mediante un protocolo experimental estructurado
en dos etapas, una con recursos computacionales estándar y otra con hardware de
alto rendimiento, y partiendo de un preentrenamiento en Kinetics-400, se realizó un
ajuste fino de cada modelo en los conjuntos de datos RWF-2000 y Real Life Violence
Situations (RLVS). Además, se evaluó la capacidad de generalización en un dataset
de diferente dominio, el Hockey Fights dataset.
Los resultados muestran que, si bien ViViT alcanza los rendimientos más altos en
dominios conocidos (F1-Scores de hasta 0.897 y 0.992), lo hace a costa de un elevado
costo computacional y una robustez limitada ante cambios de dominio drásticos.
Por otro lado, TSM mostró ser el modelo más equilibrado, combinando un muy
buen rendimiento (F1-Scores de 0.856 y 0.983) con una eficiencia verdaderamente
superior. Por su parte, SlowFast demostró ser la arquitectura más robusta al obtener
las mejores métricas al generalizar a dominios distintos (F1-Score de hasta 0.796 en
Hockey Fights).
Se concluye que no existe una única arquitectura superior. La elección óptima
depende de los requisitos de la aplicación, donde modelos eficientes como TSM presentan
una alternativa pragmática y de gran rendimiento frente a enfoques más
costosos como ViViT para su despliegue en sistemas reales. [EN]Automatic detection of violence in video using Artificial Intelligence
and Artificial Vision is a challenge that demands a balance between performance,
efficiency, and robustness. This Master’s Thesis conducts a comparative study of
four deep learning architectures selected for representing different philosophies in
video action recognition, each with particular characteristics: I3D, SlowFast, TSM,
and ViViT. Using a two-stage experimental protocol, one with standard computing
resources and the other with high-performance hardware, and starting with
pre-trained models on Kinetics-400, fine-tuning was performed on the RWF-2000
and Real Life Violence Situations (RLVS) datasets. Furthermore, generalization capabilities
were evaluated on a dataset from a different domain, the Hockey Fights
dataset.
The results show that, while ViViT achieves the highest performance in familiar
domains (F1 scores of up to 0.897 and 0.992), it does so at high computational cost
and limited robustness to drastic domain changes. On the other hand, TSM proved to
be the most balanced model, combining very good performance (F1 scores of 0.856
and 0.983) with truly superior efficiency. SlowFast, meanwhile, proved to be the
most robust architecture, achieving the best metrics when generalizing to different
domains (F1 scores of up to 0.796 in Hockey Fights).
It is concluded that there is no single superior architecture. The optimal choice
depends on the application requirements, where efficient models like TSM present
a pragmatic and high-performance alternative to more expensive approaches like
ViViT for deployment in real systems.
Descripción
Trabajo Fin de Máster. Máster Universitario en Sistemas Inteligentes
URI
Aparece en las colecciones













