Torna ai risultati
Scheda bibliografica · Consultazione e accesso
Artículo

Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge

Hilmi Demirhan et al · LibraryPress@UF · 2026

Materiale supplementare disponibile
Lettura rapida. Controlla i dati essenziali della risorsa e accedi al contenuto con il pulsante principale. La scheda mostra solo le informazioni necessarie per identificare, citare e aprire l’opera.

Accesso alla risorsa

Apri il contenuto dall’opzione principale o scegli un’altra fonte disponibile.

DOAJ DOAJ Articles
Entrar por DOAJ
Accesso principale

Materiale supplementare disponibile

El enlace apunta a material asociado, anexos, tablas, datos o página complementaria. No se marca como libro/texto completo.
Apri materiale

Riepilogo

Descripción general del contenido del recurso.

Agentic tool-augmented large language models are a common design for therapeutic decision support. The model can issue structured calls to external resources during inference, such as drug label endpoints, and then cite the returned evidence. In a clinical workflow, accuracy is necessary but not sufficient. In this paper we report an error analysis of NeurIPS CURE-Bench challenge submission artifacts. This audit builds on our prior plan-act-verify submission, which reached 0.696 accuracy on the hidden test set. We have audited 2,079 test questions using the tool call logs, final answer letters, and free-text explanations. Our audit highlights three reliability gaps that matter in practice. Tool calling fails at scale. Nearly all failures stem from missing required parameters, with 342,515 such cases, accounting for more than 99 percent of all failures. Duplicated stems showed extreme instability, with 154 out of 155 repeats receiving different letters. We provide a practical audit that is quantitative and implementable with standard logs and without additional annotations. We translate these findings into a deployment audit protocol for healthcare AI systems. The protocol emphasizes interface validation for tool calls, consistency checks on repeated questions, and evidence-first monitoring where tool outcomes are treated as first-class outputs.

Come citare

Elegí el formato que necesitás y copiá la referencia al portapapeles.

APA 7

al, H. D. E. (2026). Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge. https://journals.flvc.org/FLAIRS/article/view/141859

MLA

al, Hilmi Demirhan et. "Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge." 2026. https://journals.flvc.org/FLAIRS/article/view/141859.

Chicago

al, Hilmi Demirhan et. 2026. "Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge.". https://journals.flvc.org/FLAIRS/article/view/141859.

Harvard

al, H. D. E. 2026, Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge, LibraryPress@UF, available at: https://journals.flvc.org/FLAIRS/article/view/141859 [Accessed 6 Aug. 2026].

Condividi e stampa

Salva la scheda, copia il link permanente o stampala in PDF.

Esporta riferimento

Esporta il record nei formati più comuni per usarlo con un gestore bibliografico.

Dettagli della risorsa

Informazioni bibliografiche utili per verificare che sia il materiale corretto.

Titolo
Error Analysis of Agentic Tool-Augmented Reasoning in LLMs on NeurIPS CURE-Bench Challenge
Autore / collaboratori
Hilmi Demirhan et al
Editore
LibraryPress@UF
Anno di pubblicazione
2026
ISSN
2334-0754
ISSN
2334-0754
Lingua
Inglés

Soggetti

Esplora risorse correlate a partire da questi soggetti.

Copiato