Mercury 2
Inception🇺🇸
inception/mercury-2Mercury 2 is Inception Labs' diffusion-based LLM that generates responses in parallel rather than token-by-token, delivering very high throughput (1000+ tokens/second) with a 128K context window. It offers tunable reasoning and native tool use, matching Claude Haiku/Gemini Flash-class quality at much faster speeds and lower cost, ideal for latency-sensitive agentic and coding tasks.
Kostenfaktor
0.2x
Kontext
128K
Veröffentlicht
4. März 2026
Eingabe
Text
Ausgabe
Text
Unterstützung
SchlussfolgernTool-AufrufeStrukturierte Ausgaben
Worin es am besten ist
Die Kategorien, in denen dieses Modell am besten abschneidet.
Software & IT-Dienstleistungen
#219 · Top 53%
Unterhaltung, Sport & Medien
#219 · Top 53%
Wirtschaft, Management & Finanzen
#227 · Top 56%
Medizin & Gesundheitswesen
#242 · Top 63%
Leistung
Mittlere Latenz und Durchsatz, gemessen anhand aktueller Anfragen.
Durchsatz697 tok/s
Latenz