Skip to main content
Powered by ShareScore

Find research datasets worth reusing

Search datasets from major research repositories and use ShareScore to quickly assess how well each record supports discovery, access, and reuse.

21

datasets available to search

ShareScore release 0.7.1

Reset

Dataset results

21 results for “web scraping”

Learn how ShareScore rates datasets ↗
zenodo44/100

Práctica web scraping motorflash_v1

<p>Esta&nbsp;pr&aacute;ctica&nbsp;se ha realizado en&nbsp;el contexto de la asignatura de &#39;tipolog&iacute;a y ciclo de vida de los datos&#39; del Master en Ciencia de Datos de la&nbsp;Universitat&nbsp;Oberta de Catalunya. En ella, se aplican t&eacute;cnicas de web&nbsp;scraping&nbsp;utilizando el lenguaje de programaci&oacute;n Python y la librer&iacute;a&nbsp;scrapy. Los datos se han extra&iacute;do de la p&aacute;gina web de anuncios de coches de segunda mano &#39;<a href="https://www.motorflash.com/">https://www.motorflash.com/</a>&#39;, de la que se obtienen datos generales y caracter&iacute;sticas del&nbsp;veh&iacute;culo&nbsp;anunciado.&nbsp;&nbsp;</p> <p>Para conocer&nbsp;m&aacute;s&nbsp;a fondo el proceso de&nbsp;extracci&oacute;n&nbsp;puede visitar el repositorio del proyecto&nbsp;<a href="https://github.com/CarlosRea/MotorflashScraper">https://github.com/CarlosRea/MotorflashScraper</a>&nbsp;</p>

opencc-by-sa-4.0Nov 2020View details →
zenodo44/100

Iphones publicados en la página web de Back Market el 25/03/2022 extraídos con Web Scraping

<p>El dataset recoge todos los Iphone en venta a la p&aacute;gina web de Back Market el d&iacute;a 25/03/2022 a las 19:56, correspondiendo a una extracci&oacute;n con Web Scraping de esta plataforma online, que se dedica a vender productos reacondicionados.</p> <p>El conjunto de datos incluye todos los Iphone disponibles en la tienda con sus caracter&iacute;sticas principales: nombre&nbsp;del producto (<em>Producte</em>), su capacidad en Gigas (<em>Capacitat</em>), su color (<em>Color</em>), si es libre de operador (<em>Operador</em>), el precio del producto (<em>Preu</em>), la puntuaci&oacute;n del producto&nbsp;(<em>Puntuacio</em>), la empresa que ha reacondicionado el producto (<em>Reacondicionador</em>), desde donde se env&iacute;a el producto (<em>Origen_enviament</em>), los meses de garant&iacute;a (<em>Garantia</em>) y la url de cada producto (<em>Url</em>).&nbsp;</p> <p>&nbsp;</p>

opencc-by-sa-4.0Mar 2022View details →
zenodo40/100

Practica 1 Web Scraping Oil Price Data

<p>Dataset about the prices of the oil and its products with and without taxes across the years1.0</p>

opencc-by-4.0Nov 2021View details →
zenodo40/100

Web Scraping Universidad de Sevilla

<p>Proyecto de Web Scraping con Beautiful Soup (Python) realizado para la asignatura Tipolog&iacute;a y ciclo de vida de los datos, del Master en Ciencia de Datos de la UOC.<br>Se aplican las t&eacute;cnicas necesarias para extraer informaci&oacute;n de la web de la Universidad de Sevilla y generar un dataset con informaci&oacute;n sobre los grados que ofrece la misma.<br>El dataset generado contiene las siguientes variables:<br>&nbsp; &nbsp; * grado: nombre del t&iacute;tulo en cuesti&oacute;n<br>&nbsp; &nbsp; * rama: rama del conocimiento al que pertenece (Ciencias Sociales, Ciencias de la Salud, Ingenier&iacute;a..., etc.)<br>&nbsp; &nbsp; * facultad: centro de la Universidad de Sevilla responsable del t&iacute;tulo<br>&nbsp; &nbsp; * duracion: n&uacute;mero en a&ntilde;os en los que se plantea el t&iacute;tulo<br>&nbsp; &nbsp; * creditos: n&uacute;mero de cr&eacute;ditos necesarios para obtener el t&iacute;tulo<br>&nbsp; &nbsp; * oferta: n&uacute;mero total de plazas ofertadas por la Universidad de Sevilla el curso anterior<br>&nbsp; &nbsp; * demanda: n&uacute;mero total de veces que se ha solicitado una plaza durante las fases de inscripci&oacute;n</p>

opencc-by-4.0Nov 2024View details →
zenodo40/100

Tipologia de Datos UOC | Práctica 1 | Web Scraping de Booking.com

<p>El presente dataset ha sido obtenido bajo el marco de la asignatura &quot;Tipologia y ciclo de vida de los datos&quot;. Concretamente se trata del resultado obtenido tras realizar web scraping del metabuscador de hoteles &quot;Booking.com&quot; utilizando el lenguaje Python y el paquete Selenium.</p>

opencc-by-4.0Nov 2022View details →
zenodo40/100

Web scraping UOC, wines from Vinissimus

<p>Dataset with 1320 wines obtained from scraping the <a href="https://www.vinissimus.com/es/">Vinissimus</a> website.&nbsp;The code used to obtain it can be found here: <a href="https://github.com/PepIngla/webScrapingWines">Github</a>.</p> <p>It contains the following fields:</p> <p>Type: String, indicates the type of wine. It can take three values &ldquo;Vino tinto&rdquo; or red wine, &ldquo;Vino blanco&rdquo; or white wine, &ldquo;Vinos rosados y ros&eacute;&rdquo; or ros&eacute; wine&nbsp;because we have restricted our search to these types.</p> <p>Name: String, contains the name of the wine.</p> <p>Year: Integer, indicates the crop year. If it was not specified on the website its value in the database is&nbsp;-1.</p> <p>Cellar: String, wine producer.</p> <p>Region: String, the region where the wine was produced.</p> <p>Country: String, the country where the wine was produced.</p> <p>Varieties: String, grape varieties contained in the wine. If there is no variety specified on the website, we have set it to &quot;&quot;.</p> <p>Eco: String, if the wine has the &quot;eco&quot; label it takes the value &quot;ECO&quot;, otherwise, it is nan.</p> <p>Rating: Float, wine rating according to the vinissimus.com customers.</p> <p>Stars: Integer, tells us the number of stars of the wine according to the vinissimus.com customers.</p> <p>Opinions: Integer, number of opinions published on the website about the wine.</p> <p>Likes: Integer,&nbsp;number of likes by the vinissimus.com customers.</p> <p>Parker: String,&nbsp;Parker rating. If it is not available, the value is &quot;&quot;.</p> <p>Penin: String, Pe&ntilde;&iacute;n rating. If it is not available, the value is &quot;&quot;.</p> <p>Suckling: String, Suckling rating.&nbsp;&nbsp;If it is not available, the value is &quot;&quot;.</p> <p>Tim_atkin: String, Tim Atkin rating.&nbsp;&nbsp;If it is not available, the value is &quot;&quot;.</p> <p>Price: String, the price of the wine.</p> <p>Old_price: String, if the wine is on discount, it indicates the old price.</p> <p>Offer: Boolean,&nbsp;True if the wine is on discount, False otherwise.</p> <p>Volume: String, indicates the volume of the bottle.indica el volum de l&rsquo;ampolla. The default value in case it is not on the website is:&nbsp;&ldquo; / bot. 0,75 L &ldquo;.</p> <p>Image: bytes, an image of the wine bottle.</p>

opencc-by-4.0Nov 2022View details →
zenodo40/100

Practica1 Web Scraping

<p>En el&nbsp;marco&nbsp;de&nbsp;la asignatura&nbsp;&quot;Tipolog&iacute;a&nbsp;y&nbsp;ciclo&nbsp;de vida de&nbsp;los&nbsp;datos&quot; del&nbsp;M&aacute;ster&nbsp;en&nbsp;Ciencia&nbsp;de&nbsp;Datos&nbsp;de la Universitat Oberta de Catalunya,&nbsp;se ha&nbsp;llevado&nbsp;a&nbsp;cabo&nbsp;un&nbsp;proyecto&nbsp;basado&nbsp;en&nbsp;el enunciado&nbsp;de la&nbsp;Pr&aacute;ctica&nbsp;1.&nbsp;Este&nbsp;proyecto&nbsp;consiste&nbsp;en&nbsp;utilizar&nbsp;diversas&nbsp;t&eacute;cnicas&nbsp;de web&nbsp;scraping&nbsp;y&nbsp;c&oacute;digo&nbsp;en Python para&nbsp;obtener&nbsp;datos&nbsp;que&nbsp;posteriormente&nbsp;ser&aacute;n&nbsp;analizados.&nbsp;El objetivo&nbsp;principal&nbsp;es extraer&nbsp;el&nbsp;cat&aacute;logo&nbsp;completo del&nbsp;sitio&nbsp;web https://www.filmin.es/ 🎬&nbsp;y&nbsp;analizar&nbsp;la&nbsp;cantidad&nbsp;de&nbsp;contenido&nbsp;disponible en&nbsp;catal&aacute;n.&nbsp;Este&nbsp;proyecto&nbsp;tiene&nbsp;el potencial de ser escalable&nbsp;y&nbsp;aplicable a&nbsp;otras&nbsp;plataformas,&nbsp;lo que&nbsp;permitir&iacute;a&nbsp;realizar&nbsp;an&aacute;lisis&nbsp;comparativos&nbsp;entre&nbsp;ellas</p>

opencc-by-4.0Apr 2023View details →
zenodo36/100

Web-scraping Clasificación actualizada de equipos de fútbol profesional en las ligas europeas

<p>Un dataset es un una colecci&oacute;n de datos, normalmente tabulada. En este caso el conjunto de datos procede de la p&aacute;gina oficial del mayor organismo futbol&iacute;stico a nivel europeo.</p> <p>La informaci&oacute;n que p&uacute;blica la UEFA corresponde, entre otra, a todas las ligas con sus correspondientes clasificaciones de los equipos seg&uacute;n los partidos que han jugado.</p> <p>Los datos extra&iacute;dos corresponden precisamente a todos los equipos de estas ligas europeas con los puntos, posiciones, partidos&hellip; de cada uno de ellos. De ah&iacute; que se haya escogido el nombre anteriormente mencionado: Clasificaci&oacute;n actualizada de equipos de f&uacute;tbol profesional en las ligas europeas.</p>

opencc-by-4.0Apr 2020View details →
zenodo36/100

WEB SCRAPING COCHES.COM

<p>This is a dataset that collects thousands of car's features from second hand vehicle web name as coches.com</p>

opencc-by-4.0Apr 2024View details →
zenodo36/100

Anàlisi comparativa de Preus de Supermercat: Un Conjunt de Dades Extret a Partir de Web Scraping

<p>Aquesta base de dades ofereix un recull detallat de dades sobre els preus i els productes de tres de les principals cadenes de supermercats d'Espanya: Consum, Dia i Supermercats Mas. Les t&egrave;cniques avan&ccedil;ades de recopilaci&oacute; de dades de la web es van utilitzar per recopilar dades per a an&agrave;lisis comparatives de preus, investigacions de mercat i estudis acad&egrave;mics sobre economia de consumidor.</p> <p>Les dades es van obtenir l'14 de febrer de 2024 i representen els preus i la disponibilitat de productes en aquella data espec&iacute;fica. Cada registre del dataset cont&eacute; la seg&uuml;ent informaci&oacute; per a cada producte listat:</p> <ul> <li>Nom del producte</li> <li>Marca</li> <li>Preu</li> <li>Supermercat on el producte &eacute;s venut</li> <li>URL directa a la p&agrave;gina del producte per a m&eacute;s informaci&oacute;</li> </ul> <p>El proc&eacute;s de recollida de dades es va dur a terme a trav&eacute;s de scripts de Python, utilitzant la llibreria <code>Selenium</code> per interactuar amb els llocs web din&agrave;mics de Consum i <code>BeautifulSoup</code> per obtenir dades dels llocs web m&eacute;s est&agrave;tics de Dia i Supermercados Mas. Aquest enfocament assegura una recollida de dades precisa i actualitzada, adaptant-se als diferents entorns web dels supermercats.</p>

opencc-by-4.0Apr 2024View details →
zenodo36/100

Web scraping: Datos meteorológicos para predicción del tiempo en hoteles.

<p>Recopiliaci&oacute;n de las previsiones meterol&oacute;gicas de varias localizaciones de la web Ventusky para su posterior tratamiento.</p> <p>Consta de un total de 11 campos o atributos:</p> <ul> <li> <p>Destino (ubicaci&oacute;n seleccionada)</p> </li> <li> <p>Hora actual (hora de la petici&oacute;n)</p> </li> <li> <p>Fecha actual (fecha de la petici&oacute;n)</p> </li> <li> <p>Hora de pron&oacute;stico (24 h de pronostico tras la hora de petici&oacute;n)</p> </li> <li> <p>Temperatura (&ordm;C)</p> </li> <li> <p>Precipitaci&oacute;n (% probabilidad de lluvia)</p> </li> <li> <p>Velocidad del viento (km/h)</p> </li> <li> <p>R&aacute;fagas de viento (velocidad m&aacute;xima)</p> </li> <li> <p>Previsi&oacute;n de olas (m)</p> </li> <li> <p>AQI (calidad del aire microgramos/m3)</p> </li> <li> <p>Descripci&oacute;n AQI (Bueno, Moderado, No saludable para grupos sensibles, No saludable, Muy poco saludable, Peligroso).</p> </li> </ul>

opencc-by-4.0Nov 2024View details →
zenodo36/100

Web Scraping a Fitia

<p><em>Dataset</em>&nbsp;sobre la informaci&oacute; cal&ograve;rica dels aliments emprats per Fitia a l&#39;hora de calcular les ingestes di&agrave;ries dels seus usuaris.&nbsp;</p> <p>Hi ha 492 files i 5&nbsp;columnes:</p> <ol> <li>N&uacute;mero de fila (num&egrave;ric)</li> <li>Nom de l&#39;aliment (string)</li> <li>Porci&oacute; (string)</li> <li>Kcal (string)</li> <li>Categoria (string)</li> </ol>

opencc-by-4.0Apr 2023View details →
zenodo32/100

Maximitzant l'Anàlisi de Valors de l'IBEX 35: El Paper Vital del Web Scraping

<p><a href="https://github.com/javilamor/AnalisisIbex35/blob/main/Files/prac1.md#maximitzant-lan%C3%A0lisi-de-valors-de-libex-35-el-paper-vital-del-web-scraping">Maximitzant l'Anàlisi de Valors de l'IBEX 35: El Paper Vital del Web Scraping</a></p><p>El web scraping s'ha convertit en una eina essencial per a l'anàlisi de valors de l'IBEX 35. Proporciona als inversors l'avantatge d'accedir a dades actualitzades i rellevants, la qual cosa és fonamental en un mercat en constant evolució. Aprofitar aquesta tècnica els permet prendre decisions més informades i, en última instància, maximitzar les seves oportunitats d'inversió a l'IBEX 35.</p>

opencc-by-nc-nd-4.0Nov 2023View details →
zenodo32/100

Web scraping and API projects from "Online Data Collection and Management" (Spring 2022)

<p>As part of &quot;Online Data Collection and Management&quot; (taught at Tilburg University, Spring 2022), students collected publicly available datasets for use in academic research projects. With this repository, I am sharing (a) the documentation of these data sets, and (b) the associated source code that led to the collection of the data. The repository also contains the collected datasets.</p> <p>The data consists of the following projects:</p> <ul> <li>Autoscout (electric cars vs gasoline cars in the Dutch market)</li> <li>Mediamarkt (e-commerce)</li> <li>Steam API</li> <li>Twitch (chat capture)</li> <li>Zalando (e-commerce)</li> </ul> <p>Course website: https://odcm.hannesdatta.com. Archived at https://doi.org/10.5281/zenodo.6641811 (check for more recent versions if available).</p>

opencc-by-4.0Jun 2022View details →
zenodo32/100

ANALISIS KATEGORI PENILAIAN PEMBELI PADA TOKO ONLINE BERDASARKAN FITUR ULASAN DENGAN MENGGUNAKAN WEB SCRAPING

<p>ANALISIS KATEGORI PENILAIAN PEMBELI PADA TOKO ONLINE BERDASARKAN FITUR ULASAN DENGAN MENGGUNAKAN WEB SCRAPING</p>

opencc-by-4.0Oct 2021View details →
zenodo32/100

Conjunto de dados (código e imagens) utilizados em "Visualização de redes de coautoria como insumo bibliométrico à revistas científicas: uma proposta via web scraping para os periódicos Em Questão e Encontros Bibli"

<p>C&oacute;digo e imagens utilizadas no trabalho completo intitulado "Visualiza&ccedil;&atilde;o de redes de coautoria como insumo bibliom&eacute;trico &agrave; revistas cient&iacute;ficas: uma proposta via <em>web scraping</em> para os peri&oacute;dicos Em Quest&atilde;o e Encontros Bibli" publicado no peri&oacute;dico Encontros Bibli (https://periodicos.ufsc.br/index.php/eb/index)</p> <p>&nbsp;</p> <p>Acompanhe atualiza&ccedil;&otilde;es do c&oacute;digo em: https://github.com/rafaelcastanha/Webscrapig-Coauthorship</p> <p>&nbsp;</p>

opencc-by-4.0Sep 2023View details →
zenodo28/100

Web scraping de données publiques d'un échantillon de 11 ports européens

<p>Web scraping du 25 au 27 juin 2020 de donn&eacute;es publiques relatives &agrave; des enregistrements de navires d&#39;un &eacute;chantillon de 11 ports europ&eacute;ens :&nbsp; Aarhus (DK), Amsterdam (NL), Bordeaux (FR), Copenhague (DK), Dunkerque (FR), Fredericia (DK), Hambourg (DE), Klaipeda (LT), Le Havre (FR), Niedersachsen (DE) et Rotterdam (NL).</p>

opencc-by-4.0Aug 2020View details →
zenodo24/100

Practica 1:Web Scraping carsTecnicsFeatures

<p>El archivo almacena datos obtenidos mediante la aplicaci&oacute;n de web scraping en diferentes p&aacute;ginas. Se trata de una pr&aacute;ctica para la asignatura &quot;Tipolog&iacute;a y ciclo de vida de datos&quot; enmarcada en el master Data Science de la Universitat Oberta de Catalunya.</p>

opencc-by-4.0Apr 2020View details →
zenodo24/100

Dades del web scraping d'Airbnb

<p>Dades referents al web Scraping del web Airbnb.<br>Les dades contenen el titol de l'anunci del lloguer, la informació referent al lloguer, el preu per nit, el preu mínim a pagar (5 nits) i la puntuació que els clients li han donat a l'estambliment</p>

opencc-by-4.0Nov 2023View details →
zenodo24/100

Web Scraping PRACT1

<p>Dataset obtenido de realizar webscraping en el sitio web del peri&oacute;dico El Pais.</p> <p>El dataset consiste en dos campos incluidos en una misma columna, ambos en formato texto:</p> <ul> <li>Titular: t&iacute;tulo de la noticia</li> <li>Fecha: fecha en que dicha noticia fue publicada.</li> </ul> <p><span>El dataset se genera a partir de la extracci&oacute;n de titulares de varios d&iacute;as. En primer lugar, se recorre de forma iterativa el rango de fechas indicado en el c&oacute;digo para la hemeroteca. Posteriormente, y una vez concluido con el rango de fechas pasadas, se llama nuevamente a la funci&oacute;n que extrae los titulares, pero en la URL principal (la que no corresponde a la hemeroteca) y con la fecha actual del sistema cuando se ejecuta el web scraping.</span></p>

opencc-by-sa-4.0Nov 2024View details →

ScienceDex guides

Understand access before you commit

These curated guides explain access requirements, typical timelines, costs, and reuse considerations for widely used research datasets.

Compare curated datasets

Allen Brain Atlas

Allen Brain Atlas is an Allen Institute collection of brain map atlases, datasets, APIs, and analysis tools covering mouse, human, and non-human primate brain resources.

allen-brain-atlas
neuroscienceopenDocumentation, web resources, and API references are available online.
Last verified 2026-04-30Open record

Annotated Behaviour and Observability Dataset (ABODe)

ABODe is a University of Edinburgh DataShare dataset for behavior classification in group-housed mice using home-cage video, identities, bounding boxes, ground-plate positions, and annotator labels.

abode-home-cage
behavioral-neuroscienceopenThe DataShare record exposes download links for annotations, documentation, license text, and the zipped per-snippet data directory.
Last verified 2026-04-30Open record

DANDI Archive for NWB datasets

DANDI is a BRAIN Initiative archive for publishing and sharing neurophysiology data, including electrophysiology, optophysiology, and behavioral data packaged as NWB and related standards.

dandi-nwb
electrophysiologyopenPublished Dandiset metadata and archive endpoints are available through the production DANDI API.
Last verified 2026-04-30Open record

International Brain Laboratory public data

The International Brain Laboratory public data releases expose standardized mouse decision-making experiments, including Neuropixels recordings, widefield calcium imaging, behavior, and session metadata accessed through the ONE API.

ibl
behavioral-neuroscienceopenPublic sessions can be searched and loaded from the IBL public data server through ONE.
Last verified 2026-04-29Open record

OpenNeuro

OpenNeuro is a free, open platform for sharing neuroimaging datasets, with public search, dataset pages, and download paths for web, S3, DataLad, and the OpenNeuro CLI.

openneuro
neuroscienceopenPublished datasets are available on demand over the internet.
Last verified 2026-04-29Open record