Datos de investigación (Lenguajes y Sistemas Informáticos)
URI permanente para esta colecciónhttps://hdl.handle.net/11441/161770
Examinar
Envíos recientes

Conjunto de Datos Dataset of CRC-MSI-HistoTags v1.0: colorectal cancer H&E patches with microsatellite instability status and expert morphological annotations(2026) Pérez-Pérez, Manuel; Macías García, Laura; García de Sola Llamas, Carmen; García Gutiérrez, Jorge; Citología e Histología Normal y Patológica; Lenguajes y Sistemas Informáticos; García Gutiérrez, Jorge; García Gutiérrez, Jorge; Pérez-Pérez, Manuel; Agencia Estatal de Investigación. EspañaCRC-MSI-HistoTags v1.0 es un conjunto de datos de histología de cáncer colorrectal a nivel de parche. Contiene 600 parches de imagen H&E desidentificados de 512 x 512 píxeles, extraídos a 20x (resolución espacial de 0,5 um/píxel; campo de tejido de 256 x 256 um por parche), repartidos a partes iguales entre tres cohortes (200 parches cada una): la cohorte institucional Macarena, TCGA-COAD y CPTAC-COAD. Cada cohorte está equilibrada con 100 parches con inestabilidad de microsatélites (MSI) y 100 estables (MSS). Cada parche se vincula a su estado MSI/MSS y a siete anotaciones morfológicas binarias por consenso de expertos (arquitectura glandular, diferenciación tumoral, serración glandular, mucina, linfocitos intraepiteliales infiltrantes de tumor, inflamación peritumoral y necrosis intraluminal). Metodología: los parches se seleccionaron a partir de imágenes de portaobjetos completos (WSI) mediante un flujo de aprendizaje de múltiples instancias (MIL) de alta atención. El estado MSI/MSS de la cohorte Macarena se determinó por inmunohistoquímica de reparación de errores de emparejamiento (MLH1, MSH2, MSH6 y PMS2). Dos anotadores anotaron los 600 parches de forma independiente y las discrepancias se resolvieron por consenso. La cohorte institucional Macarena fue aprobada por el Comité de Ética de la Investigación de los Hospitales Universitarios Virgen Macarena-Virgen del Rocío (protocolo PID2023-147688OA-I00) y se libera como imágenes desidentificadas a nivel de parche. El conjunto de datos incluye además metadatos por parche, un manifiesto de archivos con sumas de comprobación SHA256, diccionarios de etiquetas y cohortes, un archivo de validación técnica, tablas suplementarias de trazabilidad de anotaciones y scripts de Python para cargar y validar la publicación. El conjunto describe la colección de imágenes en sí, no los resultados de ningún modelo de predicción MSI/MSS.
Conjunto de Datos Dataset FallacyES(2025-01-20) Cruz Mata, Fermín; Troyano Jiménez, José Antonio; Enríquez de Salamanca Ros, Fernando; Ortega Rodríguez, Francisco Javier; Lenguajes y Sistemas Informáticos; Ministerio de Ciencia e Innovación (MICIN). España; Agencia Estatal de Investigación. España; TIC134: Sistemas InformáticosEste recurso recopila falacias en español de dos fuentes diferenciadas. Por un lado, se han revisado y traducido las falacias prototípicas del conjunto de datos Logic en su versión corregida (https://github.com/tmakesense/logicalfallacy/tree/main/dataset-fixed), y se han añadido ejemplos similares no falaces, para habilitar la experimentación en detección además de en clasificación de falacias. Por otra parte, se han localizado y anotado ejemplos de falacias espontáneas a partir de los comentarios a noticias publicadas en la web de agregación de noticias meneame.net (http://old.meneame.net). También en este caso se han incluido ejemplos de textos no falaces extraídos de los mismos comentarios. La inclusión de este tipo de falacias surge de la observación del carácter en ocasiones poco realista de las falacias que llamamos prototípicas. Todo el proceso de anotación fue llevado a cabo por cuatro anotadores, dividiendo las tareas en grupos iguales y realizando reuniones posteriores para revisar los resultados obtenidos.
