Sistema de recompensa
grupo de estructuras neuronales responsables de las emociones positivas
From Wikipedia, the free encyclopedia
El sistema de recompensa (el circuito mesocorticolímbico) es un grupo de estructuras neuronales responsables de la prominencia de los incentivos (es decir, "querer"; deseo o ansia de una recompensa y motivación), el aprendizaje asociativo (principalmente el refuerzo positivo y el condicionamiento clásico) y las emociones con valencia positiva, particularmente las que involucran el placer como un componente central (por ejemplo, alegría, euforia y éxtasis). [1] [2] La recompensa es la propiedad atractiva y motivadora de un estímulo que induce un comportamiento apetitivo, también conocido como comportamiento de aproximación y comportamiento consumatorio. [1] Un estímulo gratificante se ha descrito como "cualquier estímulo, objeto, evento, actividad o situación que tenga el potencial de hacer que nos acerquemos a él y lo consumamos; es por definición una recompensa". [1] En el condicionamiento operante, los estímulos gratificantes funcionan como reforzadores positivos; [3] sin embargo, la afirmación inversa también es cierta: los reforzadores positivos son gratificantes. [3] [4] El sistema de recompensa motiva a los animales a acercarse a estímulos o realizar conductas que aumentan la aptitud física (sexo, alimentos ricos en energía, etc.). La supervivencia de la mayoría de las especies animales depende de maximizar el contacto con estímulos beneficiosos y minimizar el contacto con estímulos dañinos. La cognición de recompensa sirve para aumentar la probabilidad de supervivencia y reproducción al provocar aprendizaje asociativo, provocar un comportamiento de aproximación y consumación y desencadenar emociones con valencia positiva. [3] Por lo tanto, la recompensa es un mecanismo que evolucionó para ayudar a aumentar la aptitud adaptativa de los animales. [5] En la adicción a las drogas, ciertas sustancias sobreactivan el circuito de recompensa, lo que conduce a un comportamiento compulsivo de búsqueda de sustancias como resultado de la plasticidad sináptica en el circuito. [6]
Las recompensas primarias son una clase de estímulos gratificantes que facilitan la supervivencia de uno mismo y de la descendencia, e incluyen recompensas homeostáticas (por ejemplo, comida sabrosa) y reproductivas (por ejemplo, contacto sexual e inversión parental). [1] [7] Las recompensas intrínsecas son recompensas incondicionadas que son atractivas y motivan el comportamiento porque son inherentemente placenteras. [1] Las recompensas extrínsecas (por ejemplo, dinero o ver al equipo deportivo favorito ganar un partido) son recompensas condicionadas que son atractivas y motivan el comportamiento, pero no son inherentemente placenteras. [1] [8] Las recompensas extrínsecas obtienen su valor motivacional como resultado de una asociación aprendida (es decir, condicionamiento) con recompensas intrínsecas. [1] Las recompensas extrínsecas también pueden provocar placer (por ejemplo, euforia por ganar mucho dinero en la lotería) después de haber sido condicionadas clásicamente con recompensas intrínsecas. [1]
Definición
En neurociencia, el sistema de recompensa es un grupo de estructuras cerebrales y vías neuronales que son responsables de la cognición relacionada con la recompensa, incluido el aprendizaje asociativo (principalmente el condicionamiento clásico y el reforzamiento), la prominencia de los incentivos (es decir, la motivación y el "querer", deseo o ansia de una recompensa) y las emociones con valencia positiva, en particular las emociones que implican placer (es decir, el "gusto" hedónico). [3] [2]
Los términos que se utilizan comúnmente para describir el comportamiento relacionado con el componente "querer" o deseo de la recompensa incluyen el comportamiento apetitivo, el comportamiento de aproximación, el comportamiento preparatorio, el comportamiento instrumental, el comportamiento anticipatorio y la búsqueda. [9] Los términos que se utilizan comúnmente para describir el comportamiento relacionado con el componente de "gusto" o placer de la recompensa incluyen el comportamiento consumatorio y el comportamiento de toma. [9]
Las tres funciones principales de las recompensas son su capacidad para:
- Producir aprendizaje asociativo (es decir, condicionamiento clásico y refuerzo operante); [3]
- Afectan la toma de decisiones e inducen un comportamiento de aproximación (a través de la asignación de relevancia motivacional a estímulos gratificantes); [3]
- Provocar emociones con valencia positiva, en particular placer. [3]
Neuroanatomía
Descripción general
Las estructuras cerebrales que componen el sistema de recompensa se ubican principalmente dentro del circuito cortico-ganglio basal-tálamo-cortical; [10] la porción de los ganglios basales del circuito impulsa la actividad dentro del sistema de recompensa. [10] La mayoría de las vías que conectan estructuras dentro del sistema de recompensa son interneuronas glutamatérgicas, neuronas espinosas medianas GABAérgicas (MSN) y neuronas de proyección dopaminérgicas, [10] [11] aunque también contribuyen otros tipos de neuronas de proyección (por ejemplo, neuronas de proyección orexinérgicas). El sistema de recompensa incluye el área tegmental ventral, el estriado ventral (es decir, el núcleo accumbens y el tubérculo olfatorio), el estriado dorsal (es decir, el núcleo caudado y el putamen), la sustancia negra (es decir, la pars compacta y la pars reticulata), la corteza prefrontal, la corteza cingulada anterior, la corteza insular, el hipocampo, el hipotálamo (en particular, el núcleo orexinérgico en el hipotálamo lateral), el tálamo (múltiples núcleos), el núcleo subtalámico, el globo pálido (tanto externo como interno), el pálido ventral, el núcleo parabranquial, la amígdala y el resto de la amígdala extendida. [12] [10] [13] [14] [15] El núcleo dorsal del rafe y el cerebelo parecen modular algunas formas de cognición relacionada con la recompensa (es decir, aprendizaje asociativo, relevancia motivacional y emociones positivas) y también comportamientos. [16] [17] [18] El núcleo tegmental laterodorsal (LDT), el núcleo pedunculopontino (PPTg) y la habénula lateral (LHb) (tanto directamente como indirectamente a través del núcleo tegmental rostromedial (RMTg)) también son capaces de inducir saliencia aversiva y saliencia incentiva a través de sus proyecciones al área tegmental ventral (VTA). [19] Tanto la LDT como la PPTg envían proyecciones glutamatérgicas al VTA que hacen sinapsis con neuronas dopaminérgicas, y ambas pueden producir saliencia de incentivo. La LHb envía proyecciones glutamatérgicas, la mayoría de las cuales hacen sinapsis en neuronas GABAérgicas RMTg que a su vez impulsan la inhibición de las neuronas dopaminérgicas del VTA, aunque algunas proyecciones de LHb terminan en interneuronas del VTA. Estas proyecciones de LHb se activan tanto por estímulos aversivos como por la ausencia de una recompensa esperada, y la excitación de la LHb puede inducir aversión. [20] [21] [22]
La mayoría de las vías de dopamina (es decir, neuronas que utilizan el neurotransmisor dopamina para comunicarse con otras neuronas) que se proyectan fuera del área tegmental ventral son parte del sistema de recompensa; [10] en estas vías, la dopamina actúa sobre receptores tipo D1 o tipo D2 para estimular (tipo D1) o inhibir (tipo D2) la producción de AMPc. [23] Las neuronas espinosas medianas GABAérgicas del cuerpo estriado también son componentes del sistema de recompensa. [10] Los núcleos de proyección glutamatérgica en el núcleo subtalámico, la corteza prefrontal, el hipocampo, el tálamo y la amígdala se conectan con otras partes del sistema de recompensa a través de las vías del glutamato. [10] El haz prosencéfalo medial, que es un conjunto de muchas vías neuronales que median la recompensa de estimulación cerebral (es decir, la recompensa derivada de la estimulación electroquímica directa del hipotálamo lateral), también es un componente del sistema de recompensa. [24]
Existen dos teorías con respecto a la actividad del núcleo accumbens y la generación del gusto y el deseo. La inhibición (o hiper polar La hipótesis de la recompensa (denominada "recompensa") propone que el núcleo accumbens ejerce efectos inhibidores tónicos sobre estructuras posteriores como el pálido ventral, el hipotálamo o el área tegmental ventral, y que al inhibir MSNs en el núcleo accumbens (NAcc), estas estructuras se excitan, "liberando" un comportamiento relacionado con la recompensa. Si bien los agonistas del receptor GABA son capaces de provocar reacciones tanto de "gusto" como de "deseo" en el núcleo accumbens, las entradas glutamatérgicas de la amígdala basolateral, el hipocampo ventral y la corteza prefrontal medial pueden impulsar la prominencia del incentivo. Además, aunque la mayoría de los estudios encuentran que las neuronas NAcc reducen la activación en respuesta a la recompensa, varios estudios encuentran la respuesta opuesta. Esto ha llevado a la propuesta de la hipótesis de desinhibición (o despolarización), que propone que la excitación de las neuronas NAcc, o al menos ciertos subconjuntos, impulsan el comportamiento relacionado con la recompensa. [25] [26] [27]
Después de casi 50 años de investigación sobre la recompensa de la estimulación cerebral, los expertos han certificado que docenas de sitios en el cerebro mantendrán la autoestimulación intracraneal. Las regiones incluyen el hipotálamo lateral y los haces del prosencéfalo medial, que son especialmente eficaces. La estimulación allí activa fibras que forman las vías ascendentes; las vías ascendentes incluyen la vía mesolímbica de la dopamina, que se proyecta desde el área tegmental ventral hasta el núcleo accumbens. Hay varias explicaciones de por qué la vía mesolímbica de la dopamina es central para los circuitos que median la recompensa. En primer lugar, hay un marcado aumento en la liberación de dopamina de la vía mesolímbica cuando los animales realizan autoestimulación intracraneal. [5] En segundo lugar, los experimentos indican consistentemente que la recompensa de estimulación cerebral estimula el refuerzo de vías que normalmente se activan con recompensas naturales, y la recompensa de drogas o la autoestimulación intracraneal pueden ejercer una activación más poderosa de los mecanismos centrales de recompensa porque activan el centro de recompensa directamente en lugar de a través de los nervios periféricos. [5] [28] [29] En tercer lugar, cuando a los animales se les administran drogas adictivas o realizan conductas naturalmente gratificantes, como la alimentación o la actividad sexual, se produce una marcada liberación de dopamina en el núcleo accumbens. [5] Sin embargo, la dopamina no es el único compuesto de recompensa en el cerebro.
Ruta clave

Área tegmental ventral
- El área tegmental ventral (ATV) es importante para responder a estímulos y señales que indican que hay una recompensa presente. Los estímulos gratificantes (y todas las drogas adictivas) actúan sobre el circuito activando el ATV para que libere señales de dopamina al núcleo accumbens, ya sea directa o indirectamente. El ATV tiene dos vías importantes: la vía mesolímbica, que se proyecta a las regiones límbicas (estriatales) y sustenta los procesos y comportamientos motivacionales, y la vía mesocortical, que se proyecta a la corteza prefrontal y sustenta las funciones cognitivas, como el aprendizaje de señales externas, etc.
- Las neuronas dopaminérgicas en esta región convierten el aminoácido tirosina en DOPA utilizando la enzima tirosina hidroxilasa, que luego se convierte en dopamina utilizando la enzima DOPA descarboxilasa.
Cuerpo estriado (núcleo accumbens)
- El cuerpo estriado participa ampliamente en la adquisición y obtención de conductas aprendidas en respuesta a una señal gratificante. El VTA se proyecta al cuerpo estriado y activa las neuronas espinosas medianas GABAérgicas a través de los receptores D1 y D2 dentro del cuerpo estriado ventral (núcleo accumbens) y dorsal.
- El estriado ventral (el núcleo accumbens) participa ampliamente en la adquisición de conducta cuando lo alimenta el ATV, y en la provocación de conducta cuando lo alimenta el PFC. La capa NAc se proyecta hacia el pálido y el ATV, regulando las funciones límbicas y autónomas. Esto modula las propiedades de refuerzo de los estímulos y los aspectos a corto plazo de la recompensa. El núcleo NAc se proyecta a la sustancia negra y está involucrado en el desarrollo de conductas de búsqueda de recompensa y su expresión. Participa en el aprendizaje espacial, la respuesta condicional y la elección impulsiva; los elementos a largo plazo de la recompensa.
- El estriado dorsal participa en el aprendizaje, el estriado medial dorsal en el aprendizaje dirigido a objetivos y el estriado lateral dorsal en el aprendizaje de estímulo-respuesta, fundamental para la respuesta pavloviana. Tras la activación repetida por un estímulo, el núcleo accumbens puede activar el estriado dorsal a través de un bucle intraestriatal. La transición de señales del NAc al DS permite que las señales asociadas a la recompensa activen el DS sin que la recompensa en sí esté presente. Esto puede activar los antojos y las conductas de búsqueda de recompensas (y es responsable de desencadenar recaídas durante la abstinencia en la adicción).
Corteza prefrontal
- Las neuronas dopaminérgicas del VTA se proyectan al PFC, activando neuronas glutamatérgicas que se proyectan a muchas otras regiones, incluido el estriado dorsal y el NAc, lo que en última instancia permite que el PFC medie la prominencia y los comportamientos condicionales en respuesta a los estímulos.
- En particular, la abstinencia de drogas adictivas activa la corteza prefrontal, una proyección glutamatérgica al NAc, lo que genera fuertes antojos y modula el restablecimiento de conductas adictivas resultantes de la abstinencia. El PFC también interactúa con el VTA a través de la vía mesocortical y ayuda a asociar las señales ambientales con la recompensa. [30]
Hipocampo
- El hipocampo tiene múltiples funciones, entre ellas la creación y almacenamiento de recuerdos. En el circuito de recompensa, sirve para los recuerdos contextuales y las señales asociadas. En última instancia, sustenta el restablecimiento de conductas de búsqueda de recompensas a través de señales y desencadenantes contextuales.
Amígdala
- La AMY recibe entrada del VTA y envía salidas al NAc. La amígdala es importante para crear recuerdos emocionales potentes y es probable que sustente la creación de fuertes recuerdos asociados a estímulos. También es importante para mediar los efectos de ansiedad de la abstinencia y el aumento del consumo de drogas en la adicción.
Centros de placer
El placer es un componente de la recompensa, pero no todas las recompensas son placenteras (por ejemplo, el dinero no genera placer a menos que esta respuesta esté condicionada). [31] Los estímulos que son naturalmente placenteros, y por lo tanto atractivos, se conocen como recompensas intrínsecas, mientras que los estímulos que son atractivos y motivan el comportamiento de aproximación, pero no son inherentemente placenteros, se denominan recompensas extrínsecas. [1] Las recompensas extrínsecas (por ejemplo, el dinero) son gratificantes como resultado de una asociación aprendida con una recompensa intrínseca. [1] En otras palabras, las recompensas extrínsecas funcionan como imanes motivacionales que provocan reacciones de "deseo", pero no de "agrado", una vez que se han adquirido. [1]
El sistema de recompensa contiene pleasure centers o , es decir, estructuras cerebrales que median las reacciones de placer o de "gusto" a partir de recompensas intrínsecas. A 2017 de October. Se han identificado puntos calientes hedónicos en subcompartimentos dentro de la capa del núcleo accumbens, el pálido ventral, el núcleo parabranquial, la corteza orbitofrontal (COF) y la corteza insular. [2] [15] [32] El punto caliente dentro de la capa del núcleo accumbens se ubica en el cuadrante rostrodorsal de la capa medial, mientras que el punto frío hedónico se ubica en una región más posterior. El pálido ventral posterior también contiene un punto caliente hedónico, mientras que el pálido ventral anterior contiene un punto frío hedónico. En ratas, las microinyecciones de opioides, endocannabinoides y orexina son capaces de mejorar las reacciones de agrado en estos puntos calientes. [2] Se ha demostrado que los puntos calientes hedónicos ubicados en la corteza orbitofrontal anterior y la ínsula posterior responden a la orexina y los opioides en ratas, al igual que el punto frío hedónico superpuesto en la ínsula anterior y la corteza orbitofrontal posterior. [32] Por otra parte, sólo se ha demostrado que el punto caliente del núcleo parabranquial responde a los agonistas del receptor de benzodiazepina. [2]
Los puntos calientes hedónicos están vinculados funcionalmente, en el sentido de que la activación de un punto caliente resulta en el reclutamiento de los otros, como lo indica la expresión inducida de c-Fos, un gen temprano inmediato. Además, la inhibición de un punto caliente da como resultado la atenuación de los efectos de la activación de otro punto caliente. [2] [32] Por lo tanto, se cree que la activación simultánea de cada punto caliente hedónico dentro del sistema de recompensa es necesaria para generar la sensación de una euforia intensa. [33]
Querer y gustar

La prominencia del incentivo es el atributo de "querer" o "desear", que incluye un componente motivacional, que la capa del núcleo accumbens (capa NAcc) asigna a un estímulo gratificante. [35] [36] [37] El grado de neurotransmisión de dopamina hacia la capa NAcc desde la vía mesolímbica está altamente correlacionado con la magnitud de la prominencia del incentivo para los estímulos gratificantes. [36]
La activación de la región dorso-rostral del núcleo accumbens se correlaciona con aumentos en el deseo sin aumentos concurrentes en el gusto. [38] Sin embargo, la neurotransmisión dopaminérgica hacia la envoltura del núcleo accumbens es responsable no sólo de la prominencia motivacional apetitiva (es decir, prominencia de incentivo) hacia estímulos gratificantes, sino también de la prominencia motivacional aversiva, que aleja el comportamiento de estímulos indeseables. [9] [39] [40] En el cuerpo estriado dorsal, la activación de MSN que expresan D1 produce prominencia de incentivo apetitivo, mientras que la activación de MSN que expresan D2 produce aversión. En el NAcc, esta dicotomía no es tan clara, y la activación de los MSN D1 y D2 es suficiente para mejorar la motivación, [41] [42] probablemente a través de la desinhibición del VTA mediante la inhibición del pálido ventral. [43] [44]
La teoría de sensibilización a los incentivos de Robinson y Berridge de 1993 propuso que la recompensa contiene componentes psicológicos separables: deseo (incentivo) y gusto (placer). Para explicar el creciente contacto con un determinado estímulo, como el chocolate, intervienen dos factores independientes: nuestro deseo de tener el chocolate (querer) y el efecto de placer del chocolate (gustar). Según Robinson y Berridge, desear y gustar son dos aspectos del mismo proceso, por lo que las recompensas suelen ser deseadas y gustadas en el mismo grado. Sin embargo, el deseo y el gusto también cambian independientemente bajo determinadas circunstancias. Por ejemplo, las ratas que no comen después de recibir dopamina (experimentando una pérdida del deseo de comer) actúan como si todavía les gustara la comida. En otro ejemplo, los electrodos de autoestimulación activados en el hipotálamo lateral de ratas aumentan el apetito, pero también provocan reacciones más adversas a sabores como el azúcar y la sal; aparentemente, la estimulación aumenta el deseo pero no el gusto. Estos resultados demuestran que el sistema de recompensa de las ratas incluye procesos independientes de deseo y agrado. Se piensa que el componente de deseo está controlado por vías dopaminérgicas, mientras que el componente de gusto está controlado por sistemas opiáceos-GABA-endocannabinoides. [5]
Sistema anti-recompensa
Koobs y Le Moal propusieron que existe un circuito separado responsable de la atenuación de la conducta de búsqueda de recompensa, al que denominaron circuito anti-recompensa. Este componente actúa como freno en el circuito de recompensa, evitando así la búsqueda excesiva de comida, sexo, etc. Este circuito involucra múltiples partes de la amígdala (el núcleo del lecho de la estría terminal, el núcleo central), el núcleo accumbens y moléculas de señal que incluyen norepinefrina, factor liberador de corticotropina y dinorfina. También se plantea la hipótesis de que este circuito media los componentes desagradables del estrés y, por lo tanto, se piensa que está involucrado en la adicción y la abstinencia. Si bien el circuito de recompensa media el refuerzo positivo inicial involucrado en el desarrollo de la adicción, es el circuito anti-recompensa el que luego domina a través del refuerzo negativo que motiva la búsqueda de los estímulos gratificantes.
Aprendizaje
Los estímulos gratificantes pueden impulsar el aprendizaje tanto en forma de condicionamiento clásico (condicionamiento pavloviano) como de condicionamiento operante (condicionamiento instrumental). En el condicionamiento clásico, una recompensa puede actuar como un estímulo incondicionado que, cuando se asocia con el estímulo condicionado, hace que este último produzca respuestas tanto musculoesqueléticas (en forma de conductas simples de aproximación y evitación) como vegetativas. En el condicionamiento operante, una recompensa puede actuar como reforzador en el sentido de que aumenta o apoya acciones que conducen a ella misma. [3] Las conductas aprendidas pueden ser o no sensibles al valor de los resultados a los que conducen; las conductas que son sensibles a la contingencia de un resultado en el desempeño de una acción, así como al valor del resultado, están dirigidas a objetivos, mientras que las acciones provocadas que son insensibles a la contingencia o al valor se denominan hábitos. [45] Se cree que esta distinción refleja dos formas de aprendizaje: libre de modelos y basado en modelos. El aprendizaje libre del modelo implica el simple almacenamiento en caché y la actualización de valores. Por el contrario, el aprendizaje basado en modelos implica el almacenamiento y la construcción de un modelo interno de eventos que permite la inferencia y la predicción flexible. Aunque generalmente se supone que el condicionamiento pavloviano no tiene modelos, la relevancia del incentivo asignada a un estímulo condicionado es flexible con respecto a los cambios en los estados motivacionales internos. [46]
Los distintos sistemas neuronales son responsables de aprender asociaciones entre estímulos y resultados, acciones y resultados, y estímulos y respuestas. Aunque el condicionamiento clásico no se limita al sistema de recompensa, la mejora del rendimiento instrumental mediante estímulos (es decir, transferencia pavloviana-instrumental) requiere el núcleo accumbens. El aprendizaje instrumental habitual y dirigido a objetivos dependen del estriado lateral y del estriado medial, respectivamente. [47]
Durante el aprendizaje instrumental, se producen cambios opuestos en la proporción de receptores AMPA a NMDA y ERK fosforilado en las MSN de tipo D 1 y tipo D 2 que constituyen las vías directa e indirecta, respectivamente. [48] [49] Estos cambios en la plasticidad sináptica y el aprendizaje que los acompaña dependen de la activación de los receptores estriatales D1 y NMDA. La cascada intracelular activada por los receptores D1 implica el reclutamiento de la proteína quinasa A y, a través de la fosforilación resultante de DARPP-32, la inhibición de las fosfatasas que desactivan ERK. Los receptores NMDA activan ERK a través de una vía Ras-Raf-MEK-ERK diferente pero interrelacionada. La activación de ERK mediada por NMDA por sí sola es autolimitada, ya que la activación de NMDA también inhibe la inhibición mediada por PKA de las fosfatasas desactivadoras de ERK. Sin embargo, cuando las cascadas D1 y NMDA se coactivan, funcionan sinérgicamente y la activación resultante de ERK regula la plasticidad sináptica en forma de reestructuración de la espina, transporte de receptores AMPA, regulación de CREB y aumento de la excitabilidad celular mediante la inhibición de Kv4.2. [50] [51] [52]
Trastornos
Adicción
La sobreexpresión de ΔFosB (DeltaFosB), un factor de transcripción genética, en las neuronas espinosas medianas de tipo D1 del núcleo accumbens es el factor común crucial entre prácticamente todas las formas de adicción (es decir, las adicciones conductuales y las adicciones a las drogas) que induce el comportamiento relacionado con la adicción y la plasticidad neuronal. [53] [54] [55] [56] En particular, ΔFosB promueve la autoadministración, la sensibilización a la recompensa y los efectos de sensibilización cruzada a la recompensa entre drogas y conductas adictivas específicas. [53] [54] [55] [57] [58] También se sabe que ciertas modificaciones epigenéticas de las colas de las proteínas histonas (es decir, modificaciones de las histonas) en regiones específicas del cerebro desempeñan un papel crucial en la base molecular de las adicciones. [56] [59] [60] [61]
El hipotálamo lateral y el haz prosencéfalo medial han sido los sitios de recompensa de estimulación cerebral estudiados con mayor frecuencia, particularmente en estudios sobre los efectos de las drogas en la recompensa de estimulación cerebral. El sistema de neurotransmisores que se ha identificado más claramente con las acciones generadoras de hábito de las drogas de abuso es el sistema dopaminérgico mesolímbico, con sus objetivos eferentes en el núcleo accumbens y sus aferentes GABAérgicos locales. Las acciones relevantes para la recompensa de la anfetamina y la cocaína se producen en las sinapsis dopaminérgicas del núcleo accumbens y quizás en la corteza prefrontal medial. Las ratas también aprenden a presionar una palanca para inyectarse cocaína en la corteza prefrontal medial, lo que funciona aumentando la producción de dopamina en el núcleo accumbens. [62] [63] La nicotina infundida directamente en el núcleo accumbens también mejora la liberación local de dopamina, presumiblemente mediante una acción presináptica sobre las terminales dopaminérgicas de esta región. Los receptores nicotínicos se localizan en los cuerpos de las células dopaminérgicas y las inyecciones locales de nicotina aumentan la activación de las células dopaminérgicas, lo cual es fundamental para la recompensa nicotínica. [64] [65] También es probable que algunas drogas adicionales que crean hábito reduzcan la producción de neuronas espinosas medianas como consecuencia, a pesar de activar las proyecciones dopaminérgicas. En el caso de los opiáceos, el sitio de umbral más bajo para los efectos de recompensa implica acciones sobre las neuronas GABAérgicas en el área tegmental ventral, un sitio secundario de acciones de recompensa de opiáceos en las neuronas de salida espinosas medianas del núcleo accumbens. Por lo tanto, lo siguiente forma el núcleo del circuito de recompensa de fármacos actualmente caracterizado: aferentes GABAérgicos a las neuronas dopaminérgicas mesolímbicas (sustrato primario de la recompensa opiácea), las propias neuronas dopaminérgicas mesolímbicas (sustrato primario de la recompensa estimulante psicomotora) y eferentes GABAérgicos a las neuronas dopaminérgicas mesolímbicas (un sitio secundario de la recompensa opiácea). [30]
Motivación
La prominencia motivacional disfuncional aparece en una serie de síntomas y trastornos psiquiátricos. La anhedonia, tradicionalmente definida como una capacidad reducida para sentir placer, ha sido reexaminada como reflejo de una disminución de la prominencia de los incentivos, ya que la mayoría de las poblaciones anhedónicas exhiben un "gusto" intacto. [66] [67] En el otro extremo del espectro, una mayor prominencia de los incentivos, que se limita a estímulos específicos, es característica de las adicciones conductuales y a las drogas. En el caso del miedo o la paranoia, la disfunción puede radicar en una elevada prominencia aversiva. [68] En la literatura moderna, la anhedonia se asocia con las dos formas propuestas de placer: "anticipatorio" y "consumatorio".
Los estudios de neuroimagen en los diagnósticos asociados con anhedonia han informado una actividad reducida en la corteza orbitofrontal y el estriado ventral. [69] Un metanálisis informó que la anhedonia estaba asociada con una respuesta neuronal reducida a la anticipación de la recompensa en el núcleo caudado, el putamen, el núcleo accumbens y la corteza prefrontal medial (mPFC). [70]
Trastornos del estado de ánimo
Ciertos tipos de depresión se asocian con una motivación reducida, evaluada por la disposición a realizar un esfuerzo para obtener una recompensa. Estas anomalías se han vinculado tentativamente con una actividad reducida en áreas del cuerpo estriado, y aunque se plantea la hipótesis de que las anomalías dopaminérgicas desempeñan un papel, la mayoría de los estudios que investigan la función de la dopamina en la depresión han arrojado resultados inconsistentes. [71] [72] Aunque los estudios post mortem y de neuroimagen han encontrado anomalías en numerosas regiones del sistema de recompensa, pocos hallazgos se replican de manera consistente. Algunos estudios han informado de una actividad reducida del NAcc, el hipocampo, la corteza prefrontal medial (mPFC) y la corteza orbitofrontal (OFC), así como una actividad elevada de la amígdala basolateral y la corteza cingulada subgenual (sgACC) durante tareas relacionadas con la recompensa o estímulos positivos. Estas anomalías en las neuroimágenes se complementan con pocas investigaciones post mortem, pero las pocas investigaciones realizadas sugieren una reducción de las sinapsis excitatorias en el mPFC. [73] La actividad reducida en el mPFC durante las tareas relacionadas con la recompensa parece estar localizada en regiones más dorsales (es decir, la corteza cingulada pregenual), mientras que el sgACC más ventral es hiperactivo en la depresión. [74]
Los intentos de investigar los circuitos neuronales subyacentes en modelos animales también han arrojado resultados contradictorios. Se utilizan comúnmente dos paradigmas para simular la depresión: la derrota social crónica (DSCC) y el estrés crónico leve (ESL), aunque existen muchos otros. El CSDS produce una preferencia reducida por la sacarosa, interacciones sociales reducidas y una mayor inmovilidad en la prueba de natación forzada. El CMS reduce de manera similar la preferencia por la sacarosa y la desesperación conductual, según se evalúa mediante pruebas de suspensión de la cola y natación forzada. Los animales susceptibles al CSDS muestran una mayor activación fásica del VTA, y la inhibición de las proyecciones VTA-NAcc atenúa los déficits conductuales inducidos por el CSDS. [75] Sin embargo, la inhibición de las proyecciones VTA- mPFC exacerba el aislamiento social. Por otra parte, las reducciones asociadas a CMS en la preferencia por la sacarosa y la inmovilidad fueron atenuadas y exacerbadas por la excitación e inhibición del VTA, respectivamente. [76] [77] Aunque estas diferencias pueden atribuirse a diferentes protocolos de estimulación o paradigmas traduccionales deficientes, los resultados variables también pueden deberse a la funcionalidad heterogénea de las regiones relacionadas con la recompensa. [78]
La estimulación optogenética del mPFC en su conjunto produce efectos antidepresivos. Este efecto parece localizado en el homólogo de roedores del pgACC (la corteza prelímbica), ya que la estimulación del homólogo de roedores del sgACC (la corteza infralímbica) no produce efectos conductuales. Además, la estimulación cerebral profunda en la corteza infralímbica, que se cree que tiene un efecto inhibidor, también produce un efecto antidepresivo. Este hallazgo es congruente con la observación de que la inhibición farmacológica de la corteza infralímbica atenúa las conductas depresivas. [78]
Esquizofrenia
La esquizofrenia se asocia con déficits en la motivación, comúnmente agrupados bajo otros síntomas negativos como la reducción del habla espontánea. Con frecuencia se informa que la experiencia de "gustar" está intacta, [79] tanto a nivel conductual como neuronal, aunque los resultados pueden ser específicos para ciertos estímulos, como las recompensas monetarias. [80] Además, el aprendizaje implícito y las tareas simples relacionadas con la recompensa también están intactas en la esquizofrenia. [81] Más bien, los déficits en el sistema de recompensa son evidentes durante tareas relacionadas con la recompensa que son cognitivamente complejas. Estos déficits están asociados con una actividad anormal del núcleo estriatal y de la corteza oftálmica, así como con anomalías en regiones asociadas con funciones cognitivas como la corteza prefrontal dorsolateral (CPDL). [82]
Trastorno por déficit de atención e hiperactividad
En las personas con TDAH, los aspectos centrales del sistema de recompensa están poco activos, lo que hace que sea difícil obtener una recompensa de las actividades regulares. Las personas que padecen este trastorno experimentan un aumento de motivación después de que una conducta de alta estimulación desencadena una liberación de dopamina. Como consecuencia de ese impulso y recompensa, el regreso a los niveles iniciales produce una caída inmediata de la motivación. [83]
Se dice que los deterioros de la función dopaminérgica y serotoninérgica son factores clave en el TDAH. [84] Estas deficiencias pueden conducir a disfunciones ejecutivas como la desregulación del procesamiento de recompensas y la disfunción motivacional, incluida la anhedonia. [85]
Historia

La primera pista de la presencia de un sistema de recompensa en el cerebro llegó con un descubrimiento accidental de James Olds y Peter Milner en 1954. Descubrieron que las ratas realizaban comportamientos como presionar una barra para administrar una breve ráfaga de estimulación eléctrica a sitios específicos de sus cerebros. Este fenómeno se llama autoestimulación intracraneal o recompensa por estimulación cerebral. Normalmente, las ratas presionan una palanca cientos o miles de veces por hora para obtener esta estimulación cerebral y se detienen solo cuando están agotadas. Mientras se intentaba enseñar a ratas a resolver problemas y recorrer laberintos, la estimulación de ciertas regiones del cerebro donde se encontraba la estimulación parecía dar placer a los animales. Probaron lo mismo con humanos y los resultados fueron similares. La explicación de por qué los animales se involucran en un comportamiento que no tiene valor para la supervivencia de ellos mismos o de su especie es que la estimulación cerebral está activando el sistema subyacente a la recompensa. [86]
En un descubrimiento fundamental realizado en 1954, los investigadores James Olds y Peter Milner descubrieron que la estimulación eléctrica de bajo voltaje de ciertas regiones del cerebro de la rata actuaba como recompensa al enseñar a los animales a correr laberintos y resolver problemas. [87][88] Parecía que la estimulación de esas partes del cerebro proporcionaba placer a los animales, [87] y en trabajos posteriores los humanos informaron sensaciones placenteras derivadas de dicha estimulación. Cuando se puso a prueba a ratas en cajas de Skinner donde podían estimular el sistema de recompensa presionando una palanca, las ratas presionaron durante horas. [88] Las investigaciones realizadas en las dos décadas siguientes establecieron que la dopamina es una de las principales sustancias químicas que ayudan a la señalización neuronal en estas regiones, y se sugirió que la dopamina es la "sustancia química del placer" del cerebro. [89]
Ivan Pavlov fue un psicólogo que utilizó el sistema de recompensa para estudiar el condicionamiento clásico. Pavlov utilizó el sistema de recompensa recompensando a los perros con comida después de que escuchaban una campana u otro estímulo. Pavlov recompensaba a los perros para que asociaran la comida, la recompensa, con la campana, el estímulo. [90] Edward L. Thorndike utilizó el sistema de recompensa para estudiar el condicionamiento operante. Comenzó colocando gatos en una caja de rompecabezas y colocando comida fuera de la caja para que el gato quisiera escapar. Los gatos trabajaron para salir de la caja del rompecabezas y llegar a la comida. Aunque los gatos comieron la comida después de escapar de la caja, Thorndike descubrió que los gatos intentaron escapar de la caja sin la recompensa de la comida. Thorndike utilizó las recompensas de la comida y la libertad para estimular el sistema de recompensa de los gatos. Thorndike utilizó esto para ver cómo los gatos aprendieron a escapar de la caja. Más recientemente, Ivan De Araujo y sus colegas utilizaron nutrientes dentro del intestino para estimular el sistema de recompensa a través del nervio vago. [91]
Otras especies
Los animales aprenden rápidamente a presionar una barra para obtener una inyección de opiáceos directamente en el tegmento del mesencéfalo o en el núcleo accumbens. Los mismos animales no funcionan para obtener los opiáceos si las neuronas dopaminérgicas de la vía mesolímbica están inactivadas. Desde esta perspectiva, los animales, al igual que los humanos, realizan conductas que aumentan la liberación de dopamina.
Kent Berridge, un investigador en neurociencia afectiva, descubrió que los dulces (gustaban ) y amargo (no me gustó) ) los gustos produjeron expresiones orofaciales distintas, y estas expresiones fueron mostradas de manera similar por recién nacidos humanos, orangutanes y ratas. Esto fue evidencia de que el placer (específicamente, el gusto) tiene características objetivas y es esencialmente el mismo en varias especies animales. La mayoría de los estudios en neurociencia han demostrado que cuanto más dopamina se libera mediante la recompensa, más efectiva es ésta. Esto se llama impacto hedónico, que puede modificarse mediante el esfuerzo por obtener la recompensa y la recompensa misma. Berridge descubrió que bloquear los sistemas de dopamina no parecía cambiar la reacción positiva a algo dulce (medida por la expresión facial). En otras palabras, el impacto hedónico no cambió según la cantidad de azúcar. Esto desmintió la suposición convencional de que la dopamina media el placer. Incluso con alteraciones más intensas de la dopamina, los datos parecieron permanecer constantes. [92] Sin embargo, un estudio clínico de enero de 2019 que evaluó el efecto de un precursor de la dopamina (levodopa), un antagonista (risperidona) y un placebo en las respuestas de recompensa a la música – incluido el grado de placer experimentado durante los escalofríos musicales, medido por cambios en la actividad electrodérmica, así como por calificaciones subjetivas – descubrieron que la manipulación de la neurotransmisión de dopamina regula de forma bidireccional la cognición del placer (específicamente, el impacto hedónico de la música) en sujetos humanos. [93] [94] Esta investigación demostró que el aumento de la neurotransmisión de dopamina actúa como una condición sine qua non para las reacciones hedónicas placenteras a la música en los seres humanos. [93] [94]
Berridge desarrolló la hipótesis de la prominencia de los incentivos para abordar el aspecto de deseo de las recompensas. Explica el uso compulsivo de drogas por parte de drogadictos incluso cuando la droga ya no produce euforia, y los antojos experimentados incluso después de que el individuo ha terminado el proceso de abstinencia. Algunos adictos responden a ciertos estímulos que implican cambios neuronales causados por las drogas. Esta sensibilización en el cerebro es similar al efecto de la dopamina porque se producen reacciones de deseo y gusto. Los cerebros y comportamientos humanos y animales experimentan cambios similares en lo que respecta a los sistemas de recompensa porque estos sistemas son muy importantes. [92]