Data Science & Analytics

Tepto Gmbh
Marienheide, Germany
2 days ago
Apply on www.arbeitsagentur.de
Prepare application

Role details

Contract type
Internship / Graduate position
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English, German

Tech stack

Microsoft Windows Airflow Data Analysis Cluster Analysis Extract Transform Load (ETL) Python (Programming Language) NumPy Raw Data Power BI SQL Databases Large Language Models Grafana
+4 more
Pandas Information Technology Vertica Looker Analytics

Job description

Du willst Daten nicht nur anschauen, sondern in Entscheidungen, Modelle und bessere Prozesse Ăźbersetzen? Du hast Lust, an echten Use Cases zu arbeiten, Datenpipelines zu verbessern und Analysen aufzubauen, die im Alltag genutzt werden? Dann bist Du bei Tepto richtig.

Wir suchen Unterstßtzung mit Data-Science-Fokus. Idealerweise mit ersten praktischen Erfahrungen, solidem SQL-Know-how und (bestenfalls) Berßhrungspunkten mit ClickHouse. Wichtig: Wir suchen ausdrßcklich eine längerfristige Zusammenarbeit, damit Du Dich einarbeiten und Verantwortung ßbernehmen kannst.

Deine Rolle bei uns:

Du arbeitest an der Schnittstelle aus Business, Daten und Technik. Ziel ist, aus verteilten Daten saubere Datensätze, aussagekräftige Auswertungen und - wo sinnvoll - ML/LLM-Use-Cases zu entwickeln., 1) Daten verstehen, strukturieren, nutzbar machen

  • Du analysierst Datenquellen und hilfst beim Aufbau sauberer Datenmodelle (z. B. Events, Nutzer-/Kunden- und Prozessdaten).
  • Du unterstĂźtzt bei der Definition von Kennzahlen (KPIs) und Datenlogik.

2) SQL & Analytics (Kernfokus)

  • Du schreibst und optimierst SQL-Queries fĂźr Analysen, Reporting und Datentransformationen.
  • Du hilfst beim Aufbau wiederverwendbarer Views/Queries fĂźr Teams.

3) ClickHouse (Bonus, aber sehr willkommen)

  • Du arbeitest (oder lernst) ClickHouse fĂźr schnelle Analysen auf großen Datenmengen.
  • Du unterstĂźtzt bei Performance-Themen: Datenmodellierung, Aggregationen, Partitionierung (je nach Setup).

4) Data Science / ML-Use-Cases (je nach Erfahrung)

  • Du explorierst Daten (EDA), baust erste Modelle/Forecasts/Clustering oder Klassifizierungen.
  • Du entwickelst Features und evaluierst Modelle pragmatisch (nicht “Paper”, sondern Mehrwert).
  • Optional: LLM-basierte Auswertungen (z. B. Textklassifikation, Tagging, Zusammenfassungen).

5) Datenqualität & Dokumentation

  • Du hilfst, Datenqualität sichtbar zu machen (Checks, Plausibilitäten, Monitoring-Ideen).
  • Du dokumentierst Deine Ergebnisse so, dass sie nachvollziehbar und nutzbar bleiben., * Langfristige Zusammenarbeit statt kurzfristiger UnterstĂźtzung - wir wollen gemeinsam aufbauen.
  • Reale Daten, reale Entscheidungen, sichtbarer Impact.
  • Viel Gestaltungsspielraum: Du kannst Data-Strukturen und Standards mitprägen.
  • Kurze Wege, pragmatische Umsetzung, direkte Zusammenarbeit mit Stakeholdern.

Requirements

  • Laufendes Studium in Data Science, Informatik, Wirtschaftsinformatik, Statistik, Mathematik oder ähnlich (oder vergleichbare Skills).
  • Erste praktische Erfahrungen im Data-Science/Analytics-Umfeld (Uni-Projekt, Werkstudent, eigenes Projekt).
  • Gutes SQL-Verständnis (Joins, Aggregationen, Window Functions sind kein Fremdwort).
  • Analytisches Denken und Spaß daran, aus Rohdaten klare Aussagen abzuleiten.

Nice-to-haves

  • Erfahrung mit ClickHouse (oder Motivation, es schnell zu lernen).
  • Python fĂźr Data (pandas, numpy, …).
  • Erfahrung mit BI/Reporting (z. B. Grafana, Metabase, Power BI, Looker, Superset o.ä.).
  • Grundverständnis von Datenpipelines/ETL (dbt, Airflow, n8n, o.ä.). Sprachen

  • Deutsch (mind. B2/C1) fĂźr den Arbeitsalltag, Englisch fĂźr technische Dokumentation.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on www.arbeitsagentur.de
Prepare application

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

1:42 min

Combining technical skills with strong business communication

Lukas KÜlbl ¡ LIVE

2:34 min

Maximizing execution memory effectively via python numpy broadcasting

Jodie Burchell ¡ LIVE

2:03 min

Accelerating pandas dataframes using cudf module plugins

Ankit Patel Ankit Patel ¡ World Congress 2024

2:19 min

Introduction to Apache Airflow for advanced orchestration

Alan Mazankiewicz ¡ LIVE

3:33 min

Refactoring data science workflows using Rapids QDF and Pandas

Paul Graham Paul Graham ¡ LIVE

1:31 min

Selecting the ideal data stack for distinct workloads

Alan Mazankiewicz ¡ LIVE

Videos

See all

Related articles

See all