Find research datasets worth reusing
Search datasets from major research repositories and use ShareScore to quickly assess how well each record supports discovery, access, and reuse.
21
datasets available to search
ShareScore release 0.7.1
Dataset results
21 results for “web scraping”
Práctica web scraping motorflash_v1
<p>Esta práctica se ha realizado en el contexto de la asignatura de 'tipología y ciclo de vida de los datos' del Master en Ciencia de Datos de la Universitat Oberta de Catalunya. En ella, se aplican técnicas de web scraping utilizando el lenguaje de programación Python y la librería scrapy. Los datos se han extraído de la página web de anuncios de coches de segunda mano '<a href="https://www.motorflash.com/">https://www.motorflash.com/</a>', de la que se obtienen datos generales y características del vehículo anunciado. </p> <p>Para conocer más a fondo el proceso de extracción puede visitar el repositorio del proyecto <a href="https://github.com/CarlosRea/MotorflashScraper">https://github.com/CarlosRea/MotorflashScraper</a> </p>
Iphones publicados en la página web de Back Market el 25/03/2022 extraídos con Web Scraping
<p>El dataset recoge todos los Iphone en venta a la página web de Back Market el día 25/03/2022 a las 19:56, correspondiendo a una extracción con Web Scraping de esta plataforma online, que se dedica a vender productos reacondicionados.</p> <p>El conjunto de datos incluye todos los Iphone disponibles en la tienda con sus características principales: nombre del producto (<em>Producte</em>), su capacidad en Gigas (<em>Capacitat</em>), su color (<em>Color</em>), si es libre de operador (<em>Operador</em>), el precio del producto (<em>Preu</em>), la puntuación del producto (<em>Puntuacio</em>), la empresa que ha reacondicionado el producto (<em>Reacondicionador</em>), desde donde se envía el producto (<em>Origen_enviament</em>), los meses de garantía (<em>Garantia</em>) y la url de cada producto (<em>Url</em>). </p> <p> </p>
Practica 1 Web Scraping Oil Price Data
<p>Dataset about the prices of the oil and its products with and without taxes across the years1.0</p>
Web Scraping Universidad de Sevilla
<p>Proyecto de Web Scraping con Beautiful Soup (Python) realizado para la asignatura Tipología y ciclo de vida de los datos, del Master en Ciencia de Datos de la UOC.<br>Se aplican las técnicas necesarias para extraer información de la web de la Universidad de Sevilla y generar un dataset con información sobre los grados que ofrece la misma.<br>El dataset generado contiene las siguientes variables:<br> * grado: nombre del título en cuestión<br> * rama: rama del conocimiento al que pertenece (Ciencias Sociales, Ciencias de la Salud, Ingeniería..., etc.)<br> * facultad: centro de la Universidad de Sevilla responsable del título<br> * duracion: número en años en los que se plantea el título<br> * creditos: número de créditos necesarios para obtener el título<br> * oferta: número total de plazas ofertadas por la Universidad de Sevilla el curso anterior<br> * demanda: número total de veces que se ha solicitado una plaza durante las fases de inscripción</p>
Tipologia de Datos UOC | Práctica 1 | Web Scraping de Booking.com
<p>El presente dataset ha sido obtenido bajo el marco de la asignatura "Tipologia y ciclo de vida de los datos". Concretamente se trata del resultado obtenido tras realizar web scraping del metabuscador de hoteles "Booking.com" utilizando el lenguaje Python y el paquete Selenium.</p>
Web scraping UOC, wines from Vinissimus
<p>Dataset with 1320 wines obtained from scraping the <a href="https://www.vinissimus.com/es/">Vinissimus</a> website. The code used to obtain it can be found here: <a href="https://github.com/PepIngla/webScrapingWines">Github</a>.</p> <p>It contains the following fields:</p> <p>Type: String, indicates the type of wine. It can take three values “Vino tinto” or red wine, “Vino blanco” or white wine, “Vinos rosados y rosé” or rosé wine because we have restricted our search to these types.</p> <p>Name: String, contains the name of the wine.</p> <p>Year: Integer, indicates the crop year. If it was not specified on the website its value in the database is -1.</p> <p>Cellar: String, wine producer.</p> <p>Region: String, the region where the wine was produced.</p> <p>Country: String, the country where the wine was produced.</p> <p>Varieties: String, grape varieties contained in the wine. If there is no variety specified on the website, we have set it to "".</p> <p>Eco: String, if the wine has the "eco" label it takes the value "ECO", otherwise, it is nan.</p> <p>Rating: Float, wine rating according to the vinissimus.com customers.</p> <p>Stars: Integer, tells us the number of stars of the wine according to the vinissimus.com customers.</p> <p>Opinions: Integer, number of opinions published on the website about the wine.</p> <p>Likes: Integer, number of likes by the vinissimus.com customers.</p> <p>Parker: String, Parker rating. If it is not available, the value is "".</p> <p>Penin: String, Peñín rating. If it is not available, the value is "".</p> <p>Suckling: String, Suckling rating. If it is not available, the value is "".</p> <p>Tim_atkin: String, Tim Atkin rating. If it is not available, the value is "".</p> <p>Price: String, the price of the wine.</p> <p>Old_price: String, if the wine is on discount, it indicates the old price.</p> <p>Offer: Boolean, True if the wine is on discount, False otherwise.</p> <p>Volume: String, indicates the volume of the bottle.indica el volum de l’ampolla. The default value in case it is not on the website is: “ / bot. 0,75 L “.</p> <p>Image: bytes, an image of the wine bottle.</p>
Practica1 Web Scraping
<p>En el marco de la asignatura "Tipología y ciclo de vida de los datos" del Máster en Ciencia de Datos de la Universitat Oberta de Catalunya, se ha llevado a cabo un proyecto basado en el enunciado de la Práctica 1. Este proyecto consiste en utilizar diversas técnicas de web scraping y código en Python para obtener datos que posteriormente serán analizados. El objetivo principal es extraer el catálogo completo del sitio web https://www.filmin.es/ 🎬 y analizar la cantidad de contenido disponible en catalán. Este proyecto tiene el potencial de ser escalable y aplicable a otras plataformas, lo que permitiría realizar análisis comparativos entre ellas</p>
Web-scraping Clasificación actualizada de equipos de fútbol profesional en las ligas europeas
<p>Un dataset es un una colección de datos, normalmente tabulada. En este caso el conjunto de datos procede de la página oficial del mayor organismo futbolístico a nivel europeo.</p> <p>La información que pública la UEFA corresponde, entre otra, a todas las ligas con sus correspondientes clasificaciones de los equipos según los partidos que han jugado.</p> <p>Los datos extraídos corresponden precisamente a todos los equipos de estas ligas europeas con los puntos, posiciones, partidos… de cada uno de ellos. De ahí que se haya escogido el nombre anteriormente mencionado: Clasificación actualizada de equipos de fútbol profesional en las ligas europeas.</p>
WEB SCRAPING COCHES.COM
<p>This is a dataset that collects thousands of car's features from second hand vehicle web name as coches.com</p>
Anàlisi comparativa de Preus de Supermercat: Un Conjunt de Dades Extret a Partir de Web Scraping
<p>Aquesta base de dades ofereix un recull detallat de dades sobre els preus i els productes de tres de les principals cadenes de supermercats d'Espanya: Consum, Dia i Supermercats Mas. Les tècniques avançades de recopilació de dades de la web es van utilitzar per recopilar dades per a anàlisis comparatives de preus, investigacions de mercat i estudis acadèmics sobre economia de consumidor.</p> <p>Les dades es van obtenir l'14 de febrer de 2024 i representen els preus i la disponibilitat de productes en aquella data específica. Cada registre del dataset conté la següent informació per a cada producte listat:</p> <ul> <li>Nom del producte</li> <li>Marca</li> <li>Preu</li> <li>Supermercat on el producte és venut</li> <li>URL directa a la pàgina del producte per a més informació</li> </ul> <p>El procés de recollida de dades es va dur a terme a través de scripts de Python, utilitzant la llibreria <code>Selenium</code> per interactuar amb els llocs web dinàmics de Consum i <code>BeautifulSoup</code> per obtenir dades dels llocs web més estàtics de Dia i Supermercados Mas. Aquest enfocament assegura una recollida de dades precisa i actualitzada, adaptant-se als diferents entorns web dels supermercats.</p>
Web scraping: Datos meteorológicos para predicción del tiempo en hoteles.
<p>Recopiliación de las previsiones meterológicas de varias localizaciones de la web Ventusky para su posterior tratamiento.</p> <p>Consta de un total de 11 campos o atributos:</p> <ul> <li> <p>Destino (ubicación seleccionada)</p> </li> <li> <p>Hora actual (hora de la petición)</p> </li> <li> <p>Fecha actual (fecha de la petición)</p> </li> <li> <p>Hora de pronóstico (24 h de pronostico tras la hora de petición)</p> </li> <li> <p>Temperatura (ºC)</p> </li> <li> <p>Precipitación (% probabilidad de lluvia)</p> </li> <li> <p>Velocidad del viento (km/h)</p> </li> <li> <p>Ráfagas de viento (velocidad máxima)</p> </li> <li> <p>Previsión de olas (m)</p> </li> <li> <p>AQI (calidad del aire microgramos/m3)</p> </li> <li> <p>Descripción AQI (Bueno, Moderado, No saludable para grupos sensibles, No saludable, Muy poco saludable, Peligroso).</p> </li> </ul>
Web Scraping a Fitia
<p><em>Dataset</em> sobre la informació calòrica dels aliments emprats per Fitia a l'hora de calcular les ingestes diàries dels seus usuaris. </p> <p>Hi ha 492 files i 5 columnes:</p> <ol> <li>Número de fila (numèric)</li> <li>Nom de l'aliment (string)</li> <li>Porció (string)</li> <li>Kcal (string)</li> <li>Categoria (string)</li> </ol>
Maximitzant l'Anàlisi de Valors de l'IBEX 35: El Paper Vital del Web Scraping
<p><a href="https://github.com/javilamor/AnalisisIbex35/blob/main/Files/prac1.md#maximitzant-lan%C3%A0lisi-de-valors-de-libex-35-el-paper-vital-del-web-scraping">Maximitzant l'Anàlisi de Valors de l'IBEX 35: El Paper Vital del Web Scraping</a></p><p>El web scraping s'ha convertit en una eina essencial per a l'anàlisi de valors de l'IBEX 35. Proporciona als inversors l'avantatge d'accedir a dades actualitzades i rellevants, la qual cosa és fonamental en un mercat en constant evolució. Aprofitar aquesta tècnica els permet prendre decisions més informades i, en última instància, maximitzar les seves oportunitats d'inversió a l'IBEX 35.</p>
Web scraping and API projects from "Online Data Collection and Management" (Spring 2022)
<p>As part of "Online Data Collection and Management" (taught at Tilburg University, Spring 2022), students collected publicly available datasets for use in academic research projects. With this repository, I am sharing (a) the documentation of these data sets, and (b) the associated source code that led to the collection of the data. The repository also contains the collected datasets.</p> <p>The data consists of the following projects:</p> <ul> <li>Autoscout (electric cars vs gasoline cars in the Dutch market)</li> <li>Mediamarkt (e-commerce)</li> <li>Steam API</li> <li>Twitch (chat capture)</li> <li>Zalando (e-commerce)</li> </ul> <p>Course website: https://odcm.hannesdatta.com. Archived at https://doi.org/10.5281/zenodo.6641811 (check for more recent versions if available).</p>
ANALISIS KATEGORI PENILAIAN PEMBELI PADA TOKO ONLINE BERDASARKAN FITUR ULASAN DENGAN MENGGUNAKAN WEB SCRAPING
<p>ANALISIS KATEGORI PENILAIAN PEMBELI PADA TOKO ONLINE BERDASARKAN FITUR ULASAN DENGAN MENGGUNAKAN WEB SCRAPING</p>
Conjunto de dados (código e imagens) utilizados em "Visualização de redes de coautoria como insumo bibliométrico à revistas científicas: uma proposta via web scraping para os periódicos Em Questão e Encontros Bibli"
<p>Código e imagens utilizadas no trabalho completo intitulado "Visualização de redes de coautoria como insumo bibliométrico à revistas científicas: uma proposta via <em>web scraping</em> para os periódicos Em Questão e Encontros Bibli" publicado no periódico Encontros Bibli (https://periodicos.ufsc.br/index.php/eb/index)</p> <p> </p> <p>Acompanhe atualizações do código em: https://github.com/rafaelcastanha/Webscrapig-Coauthorship</p> <p> </p>
Web scraping de données publiques d'un échantillon de 11 ports européens
<p>Web scraping du 25 au 27 juin 2020 de données publiques relatives à des enregistrements de navires d'un échantillon de 11 ports européens : Aarhus (DK), Amsterdam (NL), Bordeaux (FR), Copenhague (DK), Dunkerque (FR), Fredericia (DK), Hambourg (DE), Klaipeda (LT), Le Havre (FR), Niedersachsen (DE) et Rotterdam (NL).</p>
Practica 1:Web Scraping carsTecnicsFeatures
<p>El archivo almacena datos obtenidos mediante la aplicación de web scraping en diferentes páginas. Se trata de una práctica para la asignatura "Tipología y ciclo de vida de datos" enmarcada en el master Data Science de la Universitat Oberta de Catalunya.</p>
Dades del web scraping d'Airbnb
<p>Dades referents al web Scraping del web Airbnb.<br>Les dades contenen el titol de l'anunci del lloguer, la informació referent al lloguer, el preu per nit, el preu mínim a pagar (5 nits) i la puntuació que els clients li han donat a l'estambliment</p>
Web Scraping PRACT1
<p>Dataset obtenido de realizar webscraping en el sitio web del periódico El Pais.</p> <p>El dataset consiste en dos campos incluidos en una misma columna, ambos en formato texto:</p> <ul> <li>Titular: título de la noticia</li> <li>Fecha: fecha en que dicha noticia fue publicada.</li> </ul> <p><span>El dataset se genera a partir de la extracción de titulares de varios días. En primer lugar, se recorre de forma iterativa el rango de fechas indicado en el código para la hemeroteca. Posteriormente, y una vez concluido con el rango de fechas pasadas, se llama nuevamente a la función que extrae los titulares, pero en la URL principal (la que no corresponde a la hemeroteca) y con la fecha actual del sistema cuando se ejecuta el web scraping.</span></p>
ScienceDex guides
Understand access before you commit
These curated guides explain access requirements, typical timelines, costs, and reuse considerations for widely used research datasets.
Allen Brain Atlas
Allen Brain Atlas is an Allen Institute collection of brain map atlases, datasets, APIs, and analysis tools covering mouse, human, and non-human primate brain resources.
Annotated Behaviour and Observability Dataset (ABODe)
ABODe is a University of Edinburgh DataShare dataset for behavior classification in group-housed mice using home-cage video, identities, bounding boxes, ground-plate positions, and annotator labels.
DANDI Archive for NWB datasets
DANDI is a BRAIN Initiative archive for publishing and sharing neurophysiology data, including electrophysiology, optophysiology, and behavioral data packaged as NWB and related standards.
International Brain Laboratory public data
The International Brain Laboratory public data releases expose standardized mouse decision-making experiments, including Neuropixels recordings, widefield calcium imaging, behavior, and session metadata accessed through the ONE API.
OpenNeuro
OpenNeuro is a free, open platform for sharing neuroimaging datasets, with public search, dataset pages, and download paths for web, S3, DataLad, and the OpenNeuro CLI.