La IA de Discourse se sale por los bordes

Acabo de tener una conversación bizarra con la IA de ayuda. Me dio malos consejos dos veces y luego negó por completo haber dicho lo que acababa de decir. Incluso cuando le pegué capturas de pantalla y copias de texto, seguía negándolo y me acusaba de mentirle. O la IA está enloqueciendo o yo :slight_smile:

De todos modos, claramente está fallando de varias maneras, así que pensé que valía la pena mencionarlo aquí.

Si por casualidad sabes qué modelo se estaba utilizando, junto con cualquier configuración relevante, como el nivel de razonamiento, esa información podría ser útil. Diferentes modelos y configuraciones de razonamiento pueden comportarse de manera distinta, por lo que esos detalles podrían ayudar a acotar lo que sucedió.


Nota:

Soy un usuario habitual del foro de Discourse de OpenAI, por lo que estoy bastante acostumbrado a ver informes sobre respuestas contradictorias de la IA, pérdida o malinterpretación del contexto conversacional y casos en los que un modelo niega incorrectamente algo que dijo anteriormente.

Por lo que he observado allí, los informes tan extremos parecen ser menos comunes ahora de lo que eran cuando los modelos de razonamiento comenzaron a estar ampliamente disponibles hace más de un año, aunque se trata solo de mi impresión y no de algo que pueda cuantificar.

Gracias, ¿cómo puedo comprobar qué modelo se está utilizando? Es la primera vez que soy administrador de un foro de Discourse, así que aún me estoy acostumbrando. No recuerdo haber realizado ningún cambio relacionado con la IA, por lo que asumo que la IA es la predeterminada de Discourse.

Por cierto, se trata de un foro alojado.

Esa es exactamente la pregunta que intentaría resolver si yo fuera un administrador que está siguiendo un informe como este.

Soy administrador en otro foro alojado con Discourse, así que haré una pequeña investigación.



También le pedí a ChatGPT que revisara mi respuesta y añadió lo siguiente, que ahora voy a verificar, pero quería compartirlo para que no tengas que esperar.

Según la documentación de Discourse AI, los administradores pueden inspeccionar los modelos configurados en:

Admin → Plugins → Discourse AI → LLMs

Las funciones de Discourse AI también se basan en personas, y una persona puede configurarse para utilizar un LLM en particular. La configuración actual de la función de IA puede mostrar qué persona y qué LLM están impulsando una función específica.

Referencias útiles:

Lo que aún no he encontrado es una forma documentada para que un usuario común inspeccione una conversación de Help AI completada y vea el modelo exacto que manejó esa interacción específica.

Si alguien sabe si esa información se expone a los usuarios, a los administradores o en los registros del sitio para una solicitud individual, por favor añádala aquí. Sería útil para informes como este.


Al revisar la sección generada por IA anterior, que dejo sin cambios por transparencia, haría algunas correcciones.

Primero, eliminaría el enlace Discourse AI – AI bot. No parece necesario para responder a la pregunta específica sobre qué modelo se está utilizando.

También eliminaría:

What I have not yet found is a documented way for an ordinary user to inspect a completed Help AI conversation and see the exact model that handled that specific interaction.

Esa limitación no es especialmente relevante aquí, ya que indicaste que eres administrador, por lo que tienes acceso a información de configuración a la que un usuario común no tendría acceso.

Por último, ahora que sé dónde se pueden encontrar los detalles de configuración relevantes, también eliminaría:

If someone knows whether that information is exposed to users, admins, or in the site logs for an individual request, please add it here. That would be useful for reports like this.

En este punto, la vía más útil es inspeccionar la configuración de Discourse AI y determinar qué LLM están asignados a la función Help AI.

Hay una lista muy larga de configuraciones de IA, pero estas son las principales. Avísame si necesitas buscar algo en concreto o puedo publicar la lista completa.

EDICIÓN: Tengo una cuenta de Claude completamente separada de esta y Claude es bastante útil para consultas de Discourse, pero me gustaría que el agente de ayuda de Discourse por defecto fuera mejor que una IA general.

Como no soy experto en cada una de las configuraciones actuales de Discourse AI, esta es mi mejor comprensión.

En mi sitio y en el tuyo, la configuración muestra:

Modelo de LLM predeterminado: CDCK Hosted LLM

Por lo que puedo encontrar, este es el servicio de LLM alojado de Discourse. Más precisamente, la implementación actual de CDCK/MoM es una capa de enrutamiento de Mixture of Models (Mezcla de Modelos) en lugar de un modelo fijo. Puede enrutar las solicitudes a diferentes modelos de pesos abiertos según la tarea. Discourse tiene una explicación útil aquí:

Otro lugar útil para verificar es:

/admin/plugins/discourse-ai/ai-llms

Esta es la página de configuración de LLM de Discourse AI, donde los administradores pueden ver las conexiones de LLM configuradas y qué modelos están disponibles para las funciones de Discourse AI.

Por ejemplo, en mi sitio veo:

lo cual indicará si eso es lo que respalda la acción que utilizaste.

Parece que eso responde a la pregunta que hice sobre el modelo y la configuración.

Tengo muchas menos etiquetas, así que tal vez necesite agregar algunas más.

A primera vista, me sorprendió un poco esa lista. Luego me pregunté si quizás estarías en el plan Free.

Al revisar tu tema anterior Changing to Full Width, encontré:

Estoy en la prueba de 14 días para la versión Pro

Así que eso satisface mi curiosidad.

Otro ejemplo para que sepas que no eres el único.

Ahora tengo el plan Pro completo, así que debería ser el predeterminado para ese caso.

Además, ahora me siento mucho más cómodo con el ancho de Discourse y he realizado los ajustes necesarios. Mirando hacia atrás, parece raro ver los foros antiguos a ancho completo :slight_smile:

En este punto, no puedo añadir mucho más, pero no quería dejar que te preguntaras si seguía investigando el asunto.

Me alegra que hayas publicado esto. Supongo que otras personas podrían encontrarse con algo similar en el futuro, y este tema ahora proporciona una documentación útil y una vía más clara para investigarlo.