EDICIÓN Nº 025 · Viernes 9 oct 2026
Tecnología

Leer una tabla solo por sus encabezados: así se vigila la calidad de los datos

Un trabajo en acceso abierto propone deducir el tipo de cada columna y sus posibles fallos a partir solo del encabezado, sin mirar las celdas, y explicando cada decisión.

Redacción2026-10-09datos · calidad de datos · grafos de conocimiento · IA explicable · arXiv
ASC Leiden - Rwanda 2021 - 037 - Screen shot of a spreadsheet for books with their price - Kigali
Foto: Gerard van de Bruinhorst · CC BY-SA 4.0 · Wikimedia Commons · realzada
Illustration-Animation course, WikiGraphers. Visualizing Open Knowledge Project
Foto: GeoO · CC BY-SA 4.0 · Wikimedia Commons

Casi todo lo que hacemos en internet acaba, tarde o temprano, en una tabla: un catálogo de productos, el registro de una estación meteorológica, la lista de pacientes de un estudio o los horarios de un tren. Para que una máquina aproveche esas tablas y las cruce entre sí, primero tiene que entender qué significa cada columna. ¿«fecha_alta» es una fecha? ¿«cp» es un código postal o un nivel de combate? Un artículo publicado en arXiv por Marcelo Valentim Silva, Hannes Herrmann y Valerie Maxville propone una forma de hacerlo con una condición difícil: leer solo los encabezados, sin tocar los datos de las celdas.

El problema: tablas que hay que entender sin poder abrirlas

La disciplina que se ocupa de esto se llama interpretación semántica de tablas. Su objetivo habitual es preparar los datos para meterlos en un grafo de conocimiento, una gran red en la que cada dato queda conectado con conceptos bien definidos (una persona, una ciudad, una fecha) y que usan buscadores, asistentes y bases de datos abiertas para relacionar información de procedencias muy distintas.

ASC Leiden - Rwanda 2021 - 039 - Screen shot of a spreadsheet for books with their prices - Kigali
Foto: Gerard van de Bruinhorst · CC BY-SA 4.0 · Wikimedia Commons

Lo normal es que los sistemas miren el contenido de las celdas para adivinar qué hay en cada columna. Pero hay muchos casos en los que eso no es posible o no conviene: los valores no están disponibles, están llenos de errores o no son adecuados para analizarlos, por ejemplo por motivos de confidencialidad. En ese escenario, al que los autores llaman «solo metadatos», el encabezado de la columna se convierte en la principal pista. Y una pista importante: según el artículo, la calidad de un grafo de conocimiento no depende únicamente de validarlo al final, sino también de la calidad de esos metadatos antes de integrarlos.

Cómo funciona por dentro

El sistema sigue una cadena de pasos sencilla de explicar, y ese es precisamente uno de sus puntos fuertes:

Creation of data-driven infographics course, WikiGraphers. Visualizing Open Knowledge Project
Foto: GeoO · CC BY-SA 4.0 · Wikimedia Commons
  • Clasificar el encabezado. Cada nombre de columna se asigna a uno de 39 tipos interpretables (los autores los llaman FinalFormat) con ayuda de recursos léxicos revisados a mano: listas de palabras y variantes que indican, por ejemplo, que algo es una fecha, un identificador o una cantidad.
  • Dejar rastro. El sistema guarda qué palabras concretas del encabezado justificaron la decisión (las SourceKeywords). Si «fecha_nacimiento» se clasifica como fecha, queda anotado que fue por «fecha». Cualquiera puede revisar el porqué.
  • Activar reglas de calidad. Cada tipo dispara una serie de comprobaciones basadas en una taxonomía de problemas de calidad de datos: datos que faltan, duplicados, valores fuera del dominio esperado, tipo de dato incorrecto o desajustes temporales.
  • Resumir en una nota. Las detecciones se agregan en HeadersIQ, una métrica ligera y sin ponderaciones que da una idea de la calidad de toda la fuente de datos, no de una columna suelta.

Además, hay un camino paralelo que intenta enlazar cada columna con vocabularios públicos muy usados, como DBpedia y Schema.org, que es lo que permite dar el salto al grafo de conocimiento.

Qué dicen los resultados (y su letra pequeña)

Los autores pusieron a prueba el sistema con colecciones de tablas muy variadas, entre ellas UCI, Kaggle, VizNet/Sato, SOTAB, T2Dv2 y la categoría de metadatos a grafo de conocimiento de la competición SemTab 2024. En total, alrededor de 120.000 columnas. Según el trabajo, el método muestra una amplia cobertura práctica incluso con metadatos reales llenos de ruido.

GIS Mapping course, WikiGraphers. Visualizing Open Knowledge Project
Foto: GeoO · CC BY-SA 4.0 · Wikimedia Commons

Ahora bien, el propio artículo es honesto con sus límites. En la prueba oficial de SemTab 2024, con la evaluación estricta frente a las respuestas de referencia, el rendimiento fue, en sus palabras, «modesto». Los investigadores hicieron después una auditoría a ciegas de los fallos y concluyen que muchos desacuerdos se deben a cómo está construida la prueba (el nivel de detalle que exige, los alias o la elección de ontología) más que a predicciones disparatadas. Pero insisten en que esa auditoría es una pista diagnóstica sobre los patrones de desacuerdo, no una nota corregida. Conviene leerlo así: el sistema es útil y transparente, no un récord.

Otra letra pequeña evidente: un encabezado no siempre dice la verdad. Columnas llamadas «col1», «valor» o abreviaturas crípticas dan poco con lo que trabajar, y depender de listas de palabras revisadas a mano implica mantenerlas al día y adaptarlas a cada idioma y dominio.

Qué cambia para el usuario

Nadie va a instalar esto en su móvil, pero sus efectos llegan por la puerta de atrás. Los datos abiertos de administraciones, los catálogos de las tiendas o los conjuntos que se usan para entrenar modelos de inteligencia artificial pasan por procesos de limpieza como este. Una herramienta que avisa pronto de que una columna de fechas tiene huecos o de que hay registros repetidos evita errores que luego se propagan a buscadores, recomendaciones o estadísticas.

Y el enfoque explicable tiene una ventaja práctica: cuando el sistema se equivoca, un humano puede ver qué palabra lo llevó al error y corregirlo, algo mucho más difícil con modelos de caja negra.

Por qué importa

En plena fiebre por los modelos de lenguaje gigantes, este trabajo recuerda que la calidad de los datos se juega antes, en tareas poco vistosas como entender bien una columna. Proponer un método trazable, que funciona incluso sin mirar las celdas y que reconoce abiertamente dónde flojea, es una contribución útil para cualquiera que mueva datos a gran escala. Y el artículo está en acceso abierto con licencia CC BY 4.0, así que cualquiera puede revisarlo.

Fuente: Marcelo Valentim Silva, Hannes Herrmann y Valerie Maxville, «An Explainable Header-Centric Framework for Large-Scale Semantic Table Interpretation and Data Quality Assessment», preprint en arXiv (2026). DOI: 10.48550/arXiv.2610.10541. Licencia CC BY 4.0.

FuentesResumen propio de la redacción a partir de las fuentes citadas; no es una traducción. Licencia de la fuente: cc-by.

Texto generado con inteligencia artificial a partir de las fuentes citadas, sin revisión humana individual (Reglamento UE 2024/1689, art. 50). Las fotos llevan su crédito y licencia; las marcadas como realzadas se han retocado con IA sin alterar su contenido.

Comentarios