WeAreDevelopers LIVE Oct 30, 2024

Lies, Damned Lies and Large Language Models

Jodie Burchell

Why do large language models confidently lie? Naive RAG pipelines often make factuality hallucinations worse. Discover how to systematically evaluate foundation models and implement adaptive retrieval.

Pause
Mute Enter Fullscreen
#1 about 3 min

Introduction to large language model hallucinations

Autoregressive text generation models produce convincing but functionally incorrect outputs due to underlying dataset abstractions.

#2 about 2 min

Transformer architecture and training data scalability

Decoder-based algorithms scale continuously by using next-word prediction across massive datasets to improve sequence generation capabilities.

#3 about 3 min

Evolution of GPT models and lossy compression

Increasing parameters in successive model generations enables the retention of structural grammar alongside specific parametric knowledge.

#4 about 3 min

Filtering unstructured web data for model training

Filtering offensive or duplicate content from datasets like Common Crawl severely impacts generated model output quality.

#5 about 2 min

Distinguishing faithfulness and factuality hallucination errors

Models exhibit errors by either ignoring explicit prompt context or relying on incorrect training data.

#6 about 3 min

Measuring text hallucinations with standardized evaluation datasets

Identifying factual inaccuracies and ingrained misconceptions requires standardized benchmark frameworks like TruthfulQA and Squad.

#7 about 6 min

Demonstrating an open source TruthfulQA evaluation pipeline

Testing multiple-choice misconception queries against language models requires setting up benchmarks using LangChain and Hugging Face.

#8 about 2 min

Analyzing large language model benchmark evaluation results

Interpreting factuality error rates from testing frameworks enables leveraging community-driven leaderboards instead of manual validation.

#9 about 3 min

Techniques for mitigating model hallucination output frequencies

Mitigation strategies include context-heavy constraint prompting, domain-specific fine-tuning, and algorithmic output evaluation techniques used alongside retrieval augmentation.

#10 about 5 min

Structuring effective retrieval augmented generation system architectures

Integrating dynamic vector database bounds into text inference adds targeted context while introducing potential data retrieval inaccuracies.

#11 about 2 min

Implementing advanced context patterns to reduce hallucinations

Using conditional retrieval methodologies like ROWAN limits unnecessary vector queries when baseline model confidence is high.

Matching moments

3:32 min

Fundamentals and limitations of large language models

Krzystof Czieslak · LIVE

1:53 min

Overcoming language model challenges using retrieval-augmented generation

Ashish Sharma · LIVE

3:29 min

Mitigating artificial intelligence hallucinations with constraints and context

Jemiah Sius Jemiah Sius · WWC 2024

1:26 min

Overcoming hallucination challenges in large language models

Michael Hunger Michael Hunger · WWC 2024

1:49 min

Addressing the risks of hallucination and chat model manipulation

Zachary Powell Zachary Powell · WWC 2024

2:35 min

Hallucinations and factual inaccuracies in generative language models

Martin O'hanlon · LIVE

Upcoming sessions on this topic

Open session

World Congress 2026 North America

Understanding LLM Architectures: Inside the Design of Modern Models

Jofia Jose Prakash

Enterprise AI Architect at American Chemical Society

Jofia Jose Prakash
Open session

World Congress 2026 North America

Fast, Cheap, and Accurate: Optimizing LLM Inference with vLLM and Quantization

Legare Kerrison, Cedric Clyburn

Legare Kerrison
Cedric Clyburn
Open session

World Congress 2026 North America

No Single Model to Rule Them All: Building Resilient AI Agents Across Open & Closed LLMs

Emmanuel Acheampong

Senior Manager Developer Relations at Crusoe AI

Emmanuel Acheampong
Open session

World Congress 2026 North America

Headroom: A Context Optimization Layer for LLM Applications

Tejas Chopra

Senior Software Engineer at Netflix

Tejas Chopra
Open session

World Congress 2026 North America

You Can’t Re-Run Sunlight: Designing ML Data Architectures for Physical AI

An Phan

Senior Data Infrastructure Engineer @ Hippo Harvest

An Phan
Open session

World Congress 2026 North America

Context Engineering Kung Fu

Carl Lapierre

Tech Lead and AI Engineer at Osedea

Carl Lapierre