Find research datasets worth reusing
Search datasets from major research repositories and use ShareScore to quickly assess how well each record supports discovery, access, and reuse.
12
datasets available to search
ShareScore release 0.9.0
Dataset results
12 results for “clasificación”
Algoritmo de clasificación de expresiones de odio por intensidades en español
<p>Algoritmo de clasificación de expresiones de odio en mensajes en español. Este algoritmo fue desarrollado en el marco del proyecto Hatemedia (PID2020-114584GB-I00), financiado por MCIN/AEI /10.13039/501100011033, con la colaboración de Possible Inc.</p> <p>Por favor lea el documento README IN SPANISH, en el que se expone todos los pasos a seguir para el uso del algoritmo desarrollado en el marco del proyecto Hatemedia (PID2020-114584GB-I00), financiado por MCIN/ AEI /10.13039/501100011033</p> <p>El algoritmo permite la clasificación de expresiones de odio, de acuerdo a 4 tipos de intensidad de odio:</p> <ul> <li>Intensidad 1 – Odio asociado a mensajes incívico</li> <li>Intensidad 2 – Odio asociado a mensajes mal intensionados o con expresiones abusivas</li> <li>Intensidad 3 – Odio asociado a insultos</li> <li>Intensidad 4 – Odio asociado a amenazas veladas o explícitas</li> </ul> <p>La estructura de carpetas con la documentación de Github es la presentada a continuación:</p> <div> <pre><code> 02 Documentación Github └── 01_Intensidades ├── DOCUMENTACIÓN GITHUB(1).docx ├── ejemplo.py ├── Modelo_intensidades.ipynb ├── obtener_caracteristicas.py └── recursos-20240304T124712Z-001.zip </code></pre> <div> </div> </div> <p>Se detalla a continuación el contenido de cada fichero:</p> <ul> <li> <p>DOCUMENTACIÓN GITHUB.docx: Informe en el que se presenta el uso de los scripts ejemplo (1).py y obtener_caracteristicas (1).py para emplear los modelos.</p> </li> <li> <p>ejemplo (1).py: Script Python que muestra el uso de los modelos para realizar predicciones.</p> </li> <li> <p>Modelo_binario_(1) (1).ipnyb: Notebook con el código utilizado para el entrenamiento de los distintos modelos.</p> </li> <li> <p>Obtener_caracteristicas (1).py: Script Python con las funciones de preprocesado utilizadas previamente al uso de los modelos para predecir las entradas de un dataframe.</p> </li> <li> <p>Recursos-20231027T110710Z-001 (1).zip: La carpeta recursos contiene 3 .csv utilizados en la extracción de características.</p> </li> </ul> <p>El dataset que se ha utilizado para el entrenamiento de los modelos es dataset_completo_caracteristicas_ampliadas_todas_combinaciones_v1_textoProcesado.csv (<a href="https://acortar.link/diSV7o" rel="nofollow">https://acortar.link/diSV7o</a>)</p> <p>El Algoritmo fue desarrollado a partir de las pruebas de los modelos aplicados que se muestran en la carpeta MODELOS. En esta carpeta se encuentran todos los resultados de los modelos utilizados durante el proceso de desarrollo de este algoritmo, con los respectivos porcentajes de entrenamiento y prueba.</p> <p>El procedimiento seguido para entrenar los modelos queda reflejado en el Informe técnico Desarrollo del algoritmo de clasificación del odio por intensidades en medios digitales españoles en X (Twitter), Facebook y portales web (<a href="https://doi.org/10.6084/m9.figshare.25884262.v2" rel="nofollow">https://doi.org/10.6084/m9.figshare.25884262.v2</a>).</p> <p>Autores: </p> <ul> <li>Xiomara Blanco</li> <li>Almudena Ruiz</li> <li>Daniel Pérez Palau</li> <li>Oscar De Gregorio</li> <li>Juan José Cubillas</li> <li>Elias Said-Hung</li> <li>Julio Montero-Díaz</li> </ul> <p>Financiado por: Agencia Estatal de Investigación – Ministerio de Ciencia e Innovación</p> <p>Con el apoyo de:</p> <ul> <li>POSSIBLE S.L.</li> </ul> <p>Más información:</p> <ul> <li><a href="https://www.hatemedia.es/" rel="nofollow">https://www.hatemedia.es/</a> o contactar con: <a href="mailto:elias.said@unir.net">elias.said@unir.net</a></li> <li>Este algoritmo está relacionado con el algoritmo de clasificación de odio/no odio, desarrollado también por los autores: <a href="https://github.com/esaidh266/Algorithm-for-classifying-hate-expressions-in-Spanish">https://github.com/esaidh266/Algorithm-for-classifying-hate-expressions-in-Spanish</a></li> </ul>
Intentos de clasificación del idioma Xinka (Gua)
<p><strong>Frauke Sachse (2010): <em>Reconstructive description of eighteenth-century Xinka grammar</em>, Netherlands Graduate School of Linguistics, Utrecht, ISBN 9789460930294.</strong></p>
Intentos de clasificación del idioma Xinka (Gua)
<p><strong>Frauke Sachse (2010): <em>Reconstructive description of eighteenth-century Xinka grammar</em>, Netherlands Graduate School of Linguistics, Utrecht, ISBN 9789460930294.</strong></p>
CLDF dataset on Quechua morphology derived from Blum et al.'s "Una aproximación filolingüística a la clasificación interna del Quechua" from 2021
<p>Cite the source of the dataset as:</p> <blockquote> <p>Blum, Frederic and Barrientos Ugarte, Carlos and Poirier, Zoe and Ingunza, Adriano. Forthcoming. Una aproximación filolingüística a la clasificación interna del Quechua. Talk to be presented at Red Europea para los Estudios Andinos, Tübingen.</p> </blockquote>
Una estrategia para la clasificación óptica de almendras (dataset)
<p><strong>Una estrategia para la clasificación óptica de almendras (dataset)</strong><br> DOI: 10.5281/zenodo.838196</p> <p># Español</p> <p>Este conjunto de datos fue generado para el trabajo «Una estrategia para la clasificación óptica de almendras» realizado por Pablo Daniel AGUADO en la Universidad Nacional de San Juan (UNSJ) en 2017 en Argentina. Contiene imágenes de objetos que típicamente se pueden encontrar en una línea de procesamiento de almendras peladas: almendras en buen estado, almendras malas, trozos de almendras, cáscaras y objetos extraños.</p> <p>El conjunto principal está en la carpeta `set3` y está etiquetado manualmente. La etiqueta de «No Almendra» es confiable al 100%; las otras («Primera» y «Mala») se usaron en base a lo establecido por la norma de UNECE para el comercio de almendras peladas [1] y pueden tener un margen de error considerable. Para el conjunto `set3` el factor de escala es de 26 px/mm.</p> <p>Si este conjunto de datos le resulta útil, considere citar el trabajo que lo originó:</p> <p>Pablo Daniel Aguado y colegas. «Una estrategia para la clasificación óptica de almendras». San Juan, Argentina: Universidad Nacional de San Juan. 2017</p> <p>```biblatex<br> @Thesis{aguadopd2017,<br> author = {Aguado, Pablo Daniel and Secchi, Humberto and Orellana, Adrián and Rossomando, Francisco and Zavalla, Eduardo},<br> title = {Una estrategia para la clasificación óptica de almendras},<br> institution = {Universidad Nacional de San Juan},<br> year = {2017},<br> language = {spanish},<br> location = {San Juan, Argentina},<br> doi = {10.5281/zenodo.838323},<br> abstract = {En este trabajo se diseñó y desarrolló un programa informático para la clasificación automática de almendras peladas mediante procesamiento de imágenes, analizando diversas características de forma y de color. Para ensayarlo se construyó un prototipo de sistema de visión artificial con el cual se creó un conjunto de 564 imágenes de almendras y otros objetos. El conjunto de imágenes fue etiquetado manualmente en base a las normas de la Comisión Económica de las Naciones Unidas para Europa (UNECE) para el comercio de almendras. Los resultados del clasificador desarrollado son similares a los obtenidos con algoritmos de clasificación estándar, como máquinas de soporte vectorial o Boosted Trees. Los descriptores elegidos permiten clasificar binariamente el conjunto con una exactitud global de 93 \%.},<br> }<br> ```</p> <p>[1] United Nations. _UNECE standard DDP-06 concerning the marketing and commercial quality control of almond kernels_. 2003</p> <p><br> _Pablo Aguado --- aguadopd at hotmail dot com_</p> <p> </p> <p>## Carpetas</p> <p>- calibracion: imágenes que se usaron para crear un modelo de la cámara con el cual corregir la distorsión.<br> - set1: 16 objetos sobre un fondo verde. Un solo lado.<br> - set2: 62 objetos sobre un fondo blanco. Imágenes de frente y reverso de cada objeto.<br> - set3: 564 objetos sobre un fondo blanco. Imágenes de frente y reverso de cada objeto + imágenes con retroiluminación de frente y reverso de cada objeto (para segmentar). Hay archivos `.csv` con listas de archivos y etiquetas y una tabla `.xlsx` con metadatos de clasificación.<br> - sindist_rec: sin distorsión y recortadas<br> - sindist_rec_bin: sin distorsión y recortadas. Las imágenes retroiluminadas están binarizadas.<br> - sindistorsion: originales desdistorsionadas.<br> </p> <p> </p> <p>--------------</p> <p><br> # English</p> <p>This dataset was generated for the project "A strategy for optical classification of almonds" by Pablo Daniel AGUADO in San Juan National University (UNSJ) in 2017 in Argentina. It has images of objects that are tipically found in a shelled almond processing line: sound kernels, bad kernels, almond fragments and foreign objects.</p> <p>The main dataset is in the folder `set3` and is manually tagged. The "No Almendra" (Not Almond) tag is 100% OK; the others ("Primera" [First class] and "Mala" [Bad]) are loosely based on the UNECE standard for shelled almonds [1] and may have a considerable error. The scale factor for the `set3` dataset is 26 px/mm.</p> <p>If this dataset is useful for you, consider citing the following work:</p> <p>Pablo Daniel Aguado et al. «Una estrategia para la clasificación óptica de almendras». San Juan, Argentina: Universidad Nacional de San Juan. 2017</p> <p>```biblatex<br> @Thesis{aguadopd2017,<br> author = {Aguado, Pablo Daniel and Secchi, Humberto and Orellana, Adrián and Rossomando, Francisco and Zavalla, Eduardo},<br> title = {Una estrategia para la clasificación óptica de almendras},<br> institution = {Universidad Nacional de San Juan},<br> year = {2017},<br> language = {spanish},<br> location = {San Juan, Argentina},<br> doi = {10.5281/zenodo.838323},<br> abstract = {En este trabajo se diseñó y desarrolló un programa informático para la clasificación automática de almendras peladas mediante procesamiento de imágenes, analizando diversas características de forma y de color. Para ensayarlo se construyó un prototipo de sistema de visión artificial con el cual se creó un conjunto de 564 imágenes de almendras y otros objetos. El conjunto de imágenes fue etiquetado manualmente en base a las normas de la Comisión Económica de las Naciones Unidas para Europa (UNECE) para el comercio de almendras. Los resultados del clasificador desarrollado son similares a los obtenidos con algoritmos de clasificación estándar, como máquinas de soporte vectorial o Boosted Trees. Los descriptores elegidos permiten clasificar binariamente el conjunto con una exactitud global de 93 \%.},<br> }<br> ```</p> <p>[1] United Nations. _UNECE standard DDP-06 concerning the marketing and commercial quality control of almond kernels_. 2003</p> <p> </p> <p>_Pablo Aguado --- aguadopd at hotmail dot com_</p> <p> </p> <p><br> ## Folders</p> <p>- calibracion: images used for creating a camera model for undistorting the images.<br> - set1: 16 objects on a green background. One side.<br> - set2: 62 objects on a white background. Images of front and back of the objects.<br> - set3: 564 objects on a white background. Images of front and back + images of front and back with backlight (for segmentation). There are `.csv` files with lists of files and tags and a `.xlsx` table with metadata of classification.<br> - sindist_rec: undistorted and cropped.<br> - sindist_rec_bin: undistorted and cropped. Backlight images are binarized.<br> - sindistorsion: undistorted originals.</p> <p> </p>
Web-scraping Clasificación actualizada de equipos de fútbol profesional en las ligas europeas
<p>Un dataset es un una colección de datos, normalmente tabulada. En este caso el conjunto de datos procede de la página oficial del mayor organismo futbolístico a nivel europeo.</p> <p>La información que pública la UEFA corresponde, entre otra, a todas las ligas con sus correspondientes clasificaciones de los equipos según los partidos que han jugado.</p> <p>Los datos extraídos corresponden precisamente a todos los equipos de estas ligas europeas con los puntos, posiciones, partidos… de cada uno de ellos. De ahí que se haya escogido el nombre anteriormente mencionado: Clasificación actualizada de equipos de fútbol profesional en las ligas europeas.</p>
Operaciones de seriación y clasificación en niños de 5 años de instituciones educativas estatales y privadas - Callao
<p>La matriz de datos contiene las siguientes variables: Nivel de seriación, Clasificación, Grupos, datos y 6 casos.</p>
[Datasets] Evaluación de la capacidad predictiva de modelos de aprendizaje supervisado para la clasificación de pacientes con cáncer colorrectal
<p><strong>DATASETS INFO</strong></p> <p>Dataset on colorectal cancer and hydroxymethylation levels ready to be used in machine learning algorithms. This dataset was generated using data from Walker NJ, Rashid M, Yu S, et al. [Dataset] Hydroxymethylation profile of cell free DNA is a biomarker for early colorectal cancer. Accessed May 17, 2023. https://zenodo.org/record/5170265#.ZGSpgHZBxD-.</p> <p><strong>ABSTRACT</strong><br> Colorectal cancer (CRC) is the second most common cause of cancer death, accounting for 9.5% of all cancer deaths. In addition to patient age, other potential risk factors should be considered to correctly identify the target population for CRC screening programmes. The identification of these risk factors would allow a personalised and accurate approach for each patient that would help improve the survival rate. Thus, the main objective of this study was to identify useful risk biomarkers for the early detection of CRC using machine learning algorithms.</p> <p>For this purpose, we compared the predictive ability of different supervised machine learning models, such as gradient boosting, support vector machines (SVM) or random forest, using a public dataset on hydroxymethylation levels in the enhancer regions in CRC patients, AAR and controls. In addition, we evaluated the suitability of K-means for the identification of CRC patient subgroups using this dataset.</p> <p>The results of this work suggested that the best supervised model to differentiate CRC patients from controls, using hydroxymethylation data, was a SVM model with linear kernel, whose sensitivity was 58% after setting the specificity to 95%, improving the model presented in the article from which the dataset was extracted. In addition, enhancers that regulate the expression of genes such as MYSM1 or SP1, or those that regulate genes encoding proteins involved in pathways such as TGF-β and integrin pathways, were identified as the most relevant enhancers when classifying samples into CRC or control. On the other hand, the use of K-means identified 6 clusters among the samples in the hydroxymethylation dataset. Two of these clusters were mainly composed of samples with CCR, however, these clusters were not associated with a specific stage of development, and the differentiation between clusters was not clear, obtaining very close clusters.</p> <p>Thus, we can conclude that hydroxymethylation data were useful for the identification of CRC biomarkers, obtaining promising results by supervised machine learning approaches. However, these results should be interpreted as preliminary, requiring validation in an external cohort and molecular analysis of the biomarkers identified.</p>
Proyecto clasificación de residuos orgánicos con ayuda de inteligencia artificial y visión artificial.
<p>Este proyecto tiene como objetivo desarrollar un sistema avanzado para la detección y clasificación de residuos utilizando inteligencia artificial y visión artificial, implementando la metodología CRISP-DM junto con técnicas de programación paralela para optimizar la eficiencia en la gestión de residuos y mitigar el impacto ambiental. La metodología CRISP-DM proporciona un marco estructurado para el análisis y el modelado de datos, comenzando con la comprensión del negocio y los datos, pasando por la preparación, modelado y evaluación (Sokolova & Lapalme, 2009). En la fase de evaluación, se implementan métricas como precisión, sensibilidad, especificidad y F1-score para medir el rendimiento del sistema y se utilizan técnicas como la validación cruzada para asegurar la robustez del modelo (Kohavi, 1995). La programación paralela en Python, junto con herramientas como OpenCV y Object Detect, facilita el procesamiento eficiente de grandes volúmenes de datos visuales. Este enfoque integral busca no solo mejorar la precisión en la clasificación de residuos, sino también asegurar la eficiencia operativa del sistema, proporcionando así una solución efectiva y sostenible para la gestión de residuos.</p> <p>Palabras clave: Detección, clasificación, residuos, CRISP-DM, Programación paralela.</p>
Clasificación de la novela policial peruana adscrita a la violencia
<p>Esta es una ponencia expuesta y subida en formato audiovisual.</p>
Aprendizaje automático para la clasificación de café tostado a partir de reflectancia espectral en el rango Visible-Nir
<p>El café es uno de los pilares de la economía colombiana, y Colombia es un productor importante de café de calidad del mundo. El departamento del Cauca tiene potencial para producir cafés de alta calidad, gracias a sus condiciones ambientales. La creciente demanda mundial de café especial aumenta la necesidad de mejorar los métodos de evaluación de la calidad del café, y el grado de tostión de los granos es importante para esta evaluación, pues determina las características de sabor del café. La presente investigación se llevó a cabo en el Parque Tecnológico del Café – Tecnicafé km 13 Corregimiento de La venta Cajibío –Cauca. En el proyecto que aquí se presenta, se desarrolló una herramienta tecnológica, que permite clasificar el café tostado en cinco grados de tostión (ligero, medio-ligero, medio, medio-alto y oscuro) usando técnicas ópticas espectrales.</p>
Clasificación de los mejores libros de todos los tiempos según Goodreads
<p>El conjunto de datos incluye información detallada sobre los 5000 mejores libros de todos los tiempos de acuerdo a una lista creada en el sitio web Goodreads. Cada libro en el conjunto de datos está representado por los siguientes campos:</p><ul><li>ranking: El ranking del libro en la lista de Goodreads.</li><li>book_name: El nombre del libro.</li><li>author_name: El nombre del autor del libro.</li><li>avg_rating: La calificación promedio del libro.</li><li>num_ratings: El número de calificaciones que el libro ha recibido.</li><li>score: La puntuación del libro.</li><li>n_people_voted: El número de personas que han votado por el libro.</li><li>book_url: La URL del libro en Goodreads.</li><li>author_url: La URL del autor en Goodreads.</li></ul><p>Además de estos campos, el conjunto de datos también incluye información adicional sobre cada libro obtenida de la página de detalles del libro en Goodreads, como:</p><ul><li>original_title: El título original del libro.</li><li>series: La serie a la que pertenece el libro.</li><li>author_role_list: La lista de autores, traductores, ilustradores, editores, etc. del libro y sus roles.</li><li>pages_format: El numero de páginas del libro en su primera edición.</li><li>publication_info: La información sobre la primera publicación del libro, como la fecha y en algunos casos el editor.</li><li>genres: Los géneros del libro.</li><li>setting: El lugar donde ocurre la historia del libro.</li><li>this_ed_pag: El número de páginas para esta edición del libro.</li><li>date_this_ed: La fecha de publicación de esta edición del libro.</li><li>publisher: El editor del libro.</li><li>language: El idioma de esta edición del libro.</li><li>ISBN13: El ISBN-13 del libro.</li><li>ISBN10: El ISBN-10 del libro.</li><li>awards_list: La lista de premios que ha recibido el libro.</li><li>people_reading: El número de personas que están leyendo el libro.</li><li>people_want_read: El número de personas que quieren leer el libro.</li><li>reviews_count_text: El número de reseñas que tiene el libro.</li><li>star5, star4, star3, star2, star1: El número de calificaciones de 5 estrellas, 4 estrellas, 3 estrellas, 2 estrellas y 1 estrella que ha recibido el libro, respectivamente.</li><li>titles_related: La lista de títulos relacionados con el libro.</li></ul><p>De manera que, el conjunto de datos proporciona una gran cantidad de información detallada sobre una amplia gama de libros, incluyendo su clasificación, detalles del libro, estadísticas de calificación y otros. Este conjunto de datos podría ser útil para una variedad de análisis y aplicaciones, como la construcción de un sistema de recomendación de libros, el análisis de tendencias en la lectura de libros, el estudio de las estadísticas de las calificaciones de los libros, entre otros.</p>
ScienceDex guides
Understand access before you commit
These curated guides explain access requirements, typical timelines, costs, and reuse considerations for widely used research datasets.
Allen Brain Atlas
Allen Brain Atlas is an Allen Institute collection of brain map atlases, datasets, APIs, and analysis tools covering mouse, human, and non-human primate brain resources.
Annotated Behaviour and Observability Dataset (ABODe)
ABODe is a University of Edinburgh DataShare dataset for behavior classification in group-housed mice using home-cage video, identities, bounding boxes, ground-plate positions, and annotator labels.
DANDI Archive for NWB datasets
DANDI is a BRAIN Initiative archive for publishing and sharing neurophysiology data, including electrophysiology, optophysiology, and behavioral data packaged as NWB and related standards.
International Brain Laboratory public data
The International Brain Laboratory public data releases expose standardized mouse decision-making experiments, including Neuropixels recordings, widefield calcium imaging, behavior, and session metadata accessed through the ONE API.
OpenNeuro
OpenNeuro is a free, open platform for sharing neuroimaging datasets, with public search, dataset pages, and download paths for web, S3, DataLad, and the OpenNeuro CLI.