Torna ai risultati
Scheda bibliografica · Consultazione e accesso
Artículo

TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception

Senyun Kuang et al · Tsinghua University Press · 2026

Materiale supplementare disponibile
Lettura rapida. Controlla i dati essenziali della risorsa e accedi al contenuto con il pulsante principale. La scheda mostra solo le informazioni necessarie per identificare, citare e aprire l’opera.

Accesso alla risorsa

Apri il contenuto dall’opzione principale o scegli un’altra fonte disponibile.

DOAJ DOAJ Articles
Entrar por DOAJ
Accesso principale

Materiale supplementare disponibile

El enlace apunta a material asociado, anexos, tablas, datos o página complementaria. No se marca como libro/texto completo.
Apri materiale

Riepilogo

Descripción general del contenido del recurso.

Understanding traffic scenes under diverse and challenging conditions is critical for intelligent transportation systems (ITSs). Existing methods primarily focus on ideal scenarios and often lack the ability to perform fine-grained perception or respond to human instructions. To address these limitations, we propose TrafficPerceiver, a unified multimodal framework based on a multimodal large language model (MLLM) that jointly supports both image understanding and target-oriented segmentation. To enhance the model’s performance under adverse conditions such as rain, fog, and motion blur, we introduce a reinforcement learning (RL) optimization strategy based on group-relative policy optimization (GRPO), which encourages interpretable, instruction-following behavior. Additionally, we construct the challenging traffic scene understanding (CTSU) dataset, a large-scale dataset tailored to challenging traffic environments, with dense annotations for both segmentation and instruction-response tasks. Extensive experiments on both the DRAMA-ROLISP and CTSU datasets demonstrate that TrafficPerceiver achieves state-of-the-art performance in both understanding and segmentation tasks.

Come citare

Elegí el formato que necesitás y copiá la referencia al portapapeles.

APA 7

al, S. K. E. (2026). TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception. https://doi.org/10.26599/COMMTR.2026.9640008

MLA

al, Senyun Kuang et. "TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception." 2026. https://doi.org/10.26599/COMMTR.2026.9640008.

Chicago

al, Senyun Kuang et. 2026. "TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception.". https://doi.org/10.26599/COMMTR.2026.9640008.

Harvard

al, S. K. E. 2026, TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception, Tsinghua University Press, available at: https://doi.org/10.26599/COMMTR.2026.9640008 [Accessed 8 Aug. 2026].

Condividi e stampa

Salva la scheda, copia il link permanente o stampala in PDF.

Esporta riferimento

Esporta il record nei formati più comuni per usarlo con un gestore bibliografico.

Dettagli della risorsa

Informazioni bibliografiche utili per verificare che sia il materiale corretto.

Titolo
TrafficPerceiver: A multimodal large language model with reinforcement learning for unified challenging traffic scene perception
Autore / collaboratori
Senyun Kuang et al
Editore
Tsinghua University Press
Anno di pubblicazione
2026
ISSN
2772-4247
ISSN
2772-4247
Lingua
Inglés

Soggetti

Esplora risorse correlate a partire da questi soggetti.

Copiato