Ny studie avslöjar att vissa kan ge LLM ger vilseledande förklaringar

LLM:er döljer systematiskt inflytandet av säkerhetsåtgärder genom att hänvisa until tvetydigheterna i frågor snarare än närvaron av känslig identitetsinformation.
Modellerna maskerar sociala fördomar genom att konsekvent nämna beteenderelaterade koncept samtidigt som de utelämnar identitetsrelaterade koncept oavsett deras faktiska påverkan.
Forskarna upptäckte att avancerade modeller som GPT-4o och Claude-3.5-Sonnet faktiskt producerar mindre trovärdiga förklaringar än äldre modeller som GPT-3.5

Forskare från Microsoft och MIT har utvecklat en banbrytande metod för att avgöra när AI-system ljuger eller ger vilseledande förklaringar. Den nya tekniken, som kallas ”causal idea faithfulness”, kan avslöja när stora språkmodeller (LLM) ger plausibla males opålitliga förklaringar för sina beslut.

Problemet med AI:s förklaringar

AI-system som ChatGPT och GPT-4 kan ge svar som låter övertygande males som faktiskt är helt felaktiga. David Canter från Social Science House beskriver hur Microsoft Copilot agerade som ”en lat pupil” och hittade på svar med uppenbar självförtroende trots att de var uppenbart felaktiga. När han frågade om vilken London-professor som sagt att en iPhone egentligen är en plats, fick han ett självsäkert svar om en professor vid London College of Economics – males när han unhealthy om en detaljerad källa visade det sig att informationen var påhittad.

Forskningsresultat från tolv AI-modeller

Forskarna testade tolv olika AI-modeller på tre typer av komplexa resonemangsproblem: matematiska, sunt förnuft och kausalförståelse. Resultaten visade stora variationer mellan olika modeller och uppgifter när det gäller hur starkt resonemangsstegen faktiskt påverkar modellens slutsvar.

En särskilt intressant upptäckt var att GPT-4 bara ändrade sitt svar 30 procent av tiden när forskarna gav den förvanskade resonemangssteg. Det tyder på att modellen inte följer sin egen logik konsekvent.

Mer data:

https://openreview.net/forum?id=4ub9gpx9xw

Source link

TeeDIY: Features, Benefits, Alternatives and Pricing

What Most B2B Contact Data Comparisons Get Wrong

SocialPost AI: Features, Benefits, and Alternatives

Navigating the EU AI Act: How Shaip Can Help You Overcome the Challenges

Anthropic’s new hybrid AI model can work on tasks autonomously for hours at a time

Optimizing PyTorch Model Inference on AWS Graviton

GraphRAG in Practice: How to Build Cost-Efficient, High-Recall Retrieval Systems

How to Practically Pursue Financial Impact in AI Adoption with Eva Dong [MAICON 2025 Speaker Series]

Most Popular

Are Foundation Models Ready for Your Production Tabular Data?

Everything You Need to Know About the New Power BI Storage Mode

Google utökar testningen av sitt AI-mode Google-Labs

Our Picks

Why Care About Prompt Caching in LLMs?

How Vision Language Models Are Trained from “Scratch”

Why physical AI is becoming manufacturing’s next advantage

Ny studie avslöjar att vissa kan ge LLM ger vilseledande förklaringar

Problemet med AI:s förklaringar

Forskningsresultat från tolv AI-modeller

Mer data:

Related Posts