Back to results
Bibliographic record · Consultation and access
Document

Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos

Crespo, María Liz et al · SEDICI UNLP · 1998

Open-access full text
Quick overview. Review the resource’s basic details, then access the content using the main button. This page shows only the information needed to identify, cite, and open the work.

Resource access

Open the content from the main option or choose another available source.

SEDICI UNLP SEDICI UNLP OAI-PMH
Entrar por SEDICI UNLP
Main access

Open-access full text

Texto completo identificado como acceso abierto.
Open text

Summary

Descripción general del contenido del recurso.

En los últimos años, el interés por el concepto de Reinforcement Learning (RL) se ha incrementado en forma considerable dentro de la comunidad de investigadores de Machine Learning e Inteligencia Artificial en general. El principal motivo fue el suceso que los métodos de RL tuvieron en la resolución de problemas, que no lograban atacar en forma satisfactoria enfoques tradicionales como Programación Dinámica y aprendizaje supervisado (por ejemplo Redes Neuronales). RL ataca el problema de aprender a controlar agentes autónomos (como por ejemplo robots), mediante interacciones por prueba y error con un ambiente dinámico, el cual le provee señales de refuerzo por cada acción que realiza. La principal virtud de RL es que permite atacar el problema de la asignación de crédito temporal, el cual consiste en asignar un apropiado crédito o censura a las acciones individuales cuando el efecto o recompensa de dichas acciones es demorado hasta que una serie de acciones se han realizado. Los conceptos teóricos fundamentales de RL, como así también algunos de sus principales métodos son descriptos a modo de survey, dirigidos a aquellas personas que tienen interés en introducirse en este área. Se presenta un análisis comparativo de los resultados obtenidos mediante métodos libres de modelo (Q-Learning) y métodos que integran aprendizaje y planificación (Dyna-Q y Prioritized Sweeping), tomando como referencia los valores obtenidos con los métodos clásicos de Programación Dinámica (Value Iteration). También se analiza el problema conocido como el dilema de la exploración-explotación, ya que en RL es el agente quien controla la distribución de los ejemplos de entrenamiento, eligiendo la secuencia de acciones a tomar. Estos métodos se aplicaron a problemas del mundo de los laberintos, típicamente usados en el área. Sistemas Inteligentes - Sesión de pósters Red de Universidades con Carreras en Informática (RedUNCI)

How to cite

Elegí el formato que necesitás y copiá la referencia al portapapeles.

APA 7

Crespo, M. L. E. A. (1998). Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos. SEDICI UNLP. http://sedici.unlp.edu.ar/handle/10915/24832

MLA

Crespo, María Liz et al. Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos. SEDICI UNLP, 1998. http://sedici.unlp.edu.ar/handle/10915/24832.

Chicago

Crespo, María Liz et al. 1998. Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos. SEDICI UNLP. http://sedici.unlp.edu.ar/handle/10915/24832.

Harvard

Crespo, M. L. E. A. 1998, Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos, SEDICI UNLP, available at: http://sedici.unlp.edu.ar/handle/10915/24832 [Accessed 10 Aug. 2026].

Share and print

Save the record, copy its permanent link, or print it as a PDF.

Export reference

You can export the record in common formats for use in a reference manager.

Resource details

Bibliographic information to help confirm that this is the correct material.

Title
Reinforcement learning: Un estudio comparativo de la performance de sus principales métodos
Author / contributors
Crespo, María Liz et al
Publisher
SEDICI UNLP
Publication year
1998
Language
Spanish

Subjects

Explore related resources through these subjects.

Copied