Reddit pone IA a moderar: Rules Hub juzga por intención y no por palabras clave

Reddit pone IA a moderar: Rules Hub juzga por intención y no por palabras clave
Fuente: techcrunch.com

Reddit ha empezado a extender Rules Hub, un sistema que usa modelos de lenguaje para decidir si un post o un comentario incumple las normas de una comunidad. La diferencia con lo que había es la clave: juzga por intención, no por palabras clave, según TechCrunch.

El anuncio llegó el 5 de agosto, junto con la decisión de restringir Old Reddit a usuarios que hayan iniciado sesión.

Puntos clave

  • Rules Hub usa LLMs para evaluar si un contenido encaja con la intención de una norma escrita en lenguaje natural.
  • Lleva "los últimos meses" en pruebas con moderadores nuevos y veteranos de más de 700 comunidades, incluido el Mod Council Network.
  • La prueba se extiende ahora a todas las comunidades de nueva creación y será ampliamente disponible en algún momento de 2026. Es opcional.
  • El moderador decide qué normas se aplican de forma automática, qué ocurre cuando saltan (mandar a cola, filtrar o retirar), previsualiza el comportamiento antes de activarlo y revisa registros.
  • Reddit dice que Rules Hub, junto a Post & Comment Guidance y Safety Filters, puede acabar sustituyendo muchos de los flujos de aplicación que hoy dependen de Automod.

El final de veinte años de expresiones regulares

Para entender por qué esto es más grande de lo que parece hay que saber qué es Automod. Es el bot que ha moderado Reddit durante más de una década, y funciona con reglas escritas a mano: listas de palabras, expresiones regulares, umbrales de karma, antigüedad mínima de cuenta.

Funciona y a la vez es una pesadilla de mantener. Si prohíbes una palabra, la gente la escribe con un cero en lugar de una o. Si subes el umbral de karma, echas a todos los usuarios nuevos legítimos junto a los trolls. Cada comunidad grande acaba con cientos de líneas de configuración que solo entiende quien las escribió y que nadie se atreve a tocar.

Rules Hub cambia el planteamiento. Escribes la norma en lenguaje normal ("nada de autopromoción disfrazada de pregunta") y el modelo juzga cada caso contra esa intención. No hay lista que mantener.

El detalle del karma

TechCrunch destaca un efecto secundario que a Reddit le interesa mucho: con esto el karma pesa menos para quien publica por primera vez.

Hoy, en muchos subreddits grandes, un usuario nuevo no puede publicar hasta acumular puntos. Es un filtro burdo contra el spam que además funciona como muro de entrada. Si el sistema puede juzgar el contenido concreto, ya no necesitas juzgar al autor por su historial.

Para Reddit eso es negocio puro: más usuarios nuevos que consiguen publicar a la primera son más usuarios que vuelven.

Y el otro movimiento del mismo día

Restringir Old Reddit a usuarios registrados no es una casualidad de calendario. Old Reddit es la interfaz antigua, ligera y sin JavaScript pesado, que resulta ser también la puerta más cómoda para los scrapers que alimentan modelos de IA.

Reddit lleva año y medio en guerra abierta con quien extrae sus datos sin pagar. Hace unos días supimos que su demanda contra Perplexity por scraping sigue viva tras la decisión de un juez de Nueva York. Cerrar Old Reddit al público no logueado es la versión técnica de la misma pelea.

Reddit usa IA para moderar mejor y a la vez cierra la puerta a que otros usen su contenido para entrenar. Coherente desde su punto de vista, aunque no quede bonito escrito seguido.

Por qué importa

Si moderas cualquier comunidad (una academia, un Slack de clientes, un foro de producto), aquí hay un patrón que puedes copiar hoy sin ser Reddit.

La idea que vale es la de escribir las normas una vez en lenguaje natural y dejar que el modelo juzgue cada caso contra ellas, en lugar de mantener listas de palabras prohibidas. Con la API de Claude o de OpenAI, un clasificador así son cincuenta líneas.

Y copia también la parte que Reddit ha hecho bien: previsualizar antes de activar, y que el resultado por defecto sea mandar a cola de revisión humana, no borrar. Un moderador automático que retira contenido sin supervisión el primer día te va a costar usuarios buenos antes de que te des cuenta.


Relacionado