World Congress 2023 • Sep 27, 2023

Data is Key: Scraping Metadata from Websites

Lars Kölker

Tired of scrapers breaking after minor UI updates? Stop relying on brittle CSS selectors. Build resilient metadata extractors using JSON-LD and Open Graph protocols.

Pause
Mute Enter Fullscreen
#1 about 2 min

How social media platforms generate link previews

Social platforms execute transformations that read hidden markup to display titles, descriptions, and dynamic content on links.

#2 about 2 min

Defining web scraping and recognizing proper use cases

Scraping becomes essential when target systems lack transparent APIs or when existing endpoints become prohibitively expensive.

#3 about 3 min

Limitations of specific CSS selectors for web scraping

Hardcoding CSS selectors restricts scraper versatility and creates breaking points whenever an underlying website updates its structure.

#4 about 2 min

Using schema.org for generic structured data extraction

Schema.org libraries define standard rules for machine-readable types and generalized properties across various content models.

#5 about 2 min

Extracting schema attributes mapped to JSON-LD structures

Adopting Google's JSON-LD format reveals precise relational metadata stored inside predefined script elements.

#6 about 2 min

Extracting basic key-value data with common meta elements

Standard HTML attributes like application name and description offer a foundational layer for key-value extraction routines.

#7 about 3 min

Using Open Graph Protocol to construct rich objects

Evaluating Open Graph specification tags accesses dedicated attribute values originally standardized by Facebook for media sharing.

#8 about 2 min

Extracting Twitter Cards markup as valuable scraping fallbacks

Falling back on Twitter-specific metadata summary tags preserves robust link scraping capabilities whenever Open Graph formats miss details.

#9 about 4 min

Utilizing the oEmbed format to query rich endpoints

Fetching an endpoint defined via oEmbed's alternate link attributes returns complex API representations of deep resources.

#10 about 2 min

Demonstrating successful metadata scraping techniques for generic previews

Chaining standard schema fallbacks populates functional link previews containing critical information like live pricing and stock changes.

#11 about 2 min

Navigating legality boundaries and request rate limits safely

Reviewing platform terms of service and restricting endpoint concurrency significantly reduces the compliance risk involved in external scraping protocols.

#12 about 2 min

Selecting suitable extraction frameworks for structured schema parsers

Dedicated Python libraries streamline generalized document parsing, though JavaScript environments often require custom logic to evaluate JSON-LD schemas effectively.

Matching moments

5:54 min

The technical evolution of modern web scraping infrastructure

Chris Heilmann Chris Heilmann +4 · LIVE

1:09 min

Exploring data collection challenges from user-generated platforms

Linda Mohamed · LIVE

2:27 min

Core definitions of modern web data extraction

Domagoj Marić Domagoj Marić · Europe 2026 Virtual

2:54 min

Technical workflow for generating self-healing scrapers

Ariel Shulman Ariel Shulman +1 · World Congress 2026 Europe

1:45 min

Concluding thoughts on scraper tools and audience questions

Alexander Lichter · World Congress 2023

1:20 min

Optimizing social media link previews with header attributes

Chris Heilmann Chris Heilmann +2 · LIVE