Qué pasa cuando alguien le pregunta a ChatGPT por tu servicio
Cada vez más gente empieza a buscar preguntando en vez de tecleando palabras sueltas. «Necesito un fontanero de urgencias en Granada», «qué detective privado hay en Sevilla», «cuánto cuesta un CRM a medida». La respuesta que reciben se construye con dos fuentes: lo que el modelo aprendió durante su entrenamiento, y lo que un rastreador ha ido a leer en ese momento para poder citar fuentes con enlace.
Esa segunda fuente es la que te interesa, porque es la que trae visitas. Y funciona con una mecánica muy poco glamurosa: un programa pide tu página, se descarga el HTML que le devuelve tu servidor, y extrae el texto. No abre un navegador. No espera a que carguen los scripts. No hace scroll. Lo que no venga en esa primera respuesta, no existe.
El fallo más caro es el más aburrido
Muchas webs modernas envían al navegador un HTML prácticamente vacío y un paquete de JavaScript que construye la página una vez ha llegado. Para una persona esto es invisible: la web carga, se ve perfecta, va rápida. Para un rastreador que no ejecuta JavaScript, esa misma página es un contenedor vacío.
Google sí renderiza JavaScript, con retraso y de forma imperfecta, así que este problema lleva años siendo un dolor de cabeza de SEO tolerable. Los rastreadores que alimentan a ChatGPT, Claude o Perplexity son bastante más simples. Con ellos no hay tolerancia: o está en el HTML, o no estás.
Compruébalo tú en treinta segundos. Abre tu web, pulsa Ctrl+U (Cmd+Option+U en Mac) para ver el código fuente, y busca con Ctrl+F una frase concreta de tu página. ¿Aparece? Bien. ¿No aparece? Entonces esa frase no existe para quien no ejecuta JavaScript.
Nos pasaba a nosotros
Este artículo sale de auditar nuestra propia web. La portada de nazarcode.com tenía un acordeón de preguntas frecuentes hecho con JavaScript: las preguntas estaban en el HTML, pero las respuestas solo se generaban al hacer clic. Seis preguntas visibles y cero respuestas para cualquier rastreador. Estaban en los datos estructurados, sí, pero muchos extractores de texto no los leen.
La solución fue cambiar el acordeón por la etiqueta <details> que trae HTML de serie: se comporta igual, funciona sin JavaScript y el texto está siempre presente. Menos código del que había antes. Lo cuento porque es exactamente el tipo de fallo que no se detecta mirando la web: en pantalla se veía perfecta.
La confusión que le cuesta clientes a mucha gente
Los rastreadores de IA no son todos iguales, y tratarlos como un bloque es el error más caro de este tema. Hay dos familias con propósitos distintos:
| Familia | Ejemplos | Qué pasa si lo bloqueas |
|---|---|---|
| Bots de búsqueda | OAI-SearchBot, ChatGPT-User, Claude-User, PerplexityBot | Desapareces de las respuestas donde te citarían con enlace. Pierdes visitas reales. |
| Bots de entrenamiento | GPTBot, ClaudeBot, Google-Extended, CCBot, Bytespider | Tu contenido no entra en el próximo modelo. Puede ser una decisión perfectamente legítima. |
El problema es que mucha gente lee un artículo alarmista sobre «la IA se roba tu contenido», copia un bloque de robots.txt que circula por ahí y bloquea las dos familias a la vez. El resultado es que protege su contenido del entrenamiento —que era lo que quería— y de paso se borra de las respuestas con cita —que no lo era—. Si eres un negocio que quiere clientes, casi siempre interesa dejar entrar al menos a los de búsqueda.
Lo que merece la pena y cuesta una tarde
Con el contenido resuelto, el resto es rápido y no cuesta dinero. Por orden de utilidad real:
- Reglas explícitas por bot en robots.txt. Decidir a conciencia quién entra, en vez de heredar una decisión que no tomaste.
- Sitemap correcto y anunciado en robots.txt. Sin él, un agente solo encuentra lo que esté enlazado desde la portada.
- Datos estructurados (schema.org). Es la única parte de tu web que un modelo no tiene que interpretar: le dices literalmente qué eres, dónde estás y a qué te dedicas.
- llms.txt. Un índice en markdown de lo que ofreces. Hoy no lo consume casi nadie; cuesta un archivo y te deja elegir cómo te resumen el día que se generalice.
- security.txt. No tiene nada que ver con agentes, pero ya que estás: seis líneas para que quien encuentre un fallo en tu web sepa a quién avisar.
Y lo que es humo
Hay herramientas que puntúan tu web contra quince estándares emergentes y te dan un suspenso por no tenerlos. Merece la pena mirar qué son antes de correr a implementarlos.
| Estándar | Qué es | Coste real |
|---|---|---|
| x402, ACP, UCP, MPP | Protocolos para que un agente pague por ti | Wallet con criptomonedas y comisiones on-chain, o pasarela de pago con comisión por transacción. Y no aplican si no vendes online. |
| MCP Server Card, WebMCP | Anunciar una API que los agentes pueden usar | Gratis el anuncio, pero exige construir y mantener el servidor. Anunciarlo sin tenerlo es publicar la dirección de una oficina que no existe. |
| Registro DNS de agente (AID) | Un TXT que dice dónde está tu endpoint y qué protocolo habla | Gratis, pero requiere lo mismo: un endpoint detrás. Además el formato aún está en borrador y ya ha cambiado de versión. |
Ninguno de estos es falso ni inútil. Simplemente describen capacidades que la mayoría de webs no tiene ni necesita. Declararlas en vacío no te hace más preparado: te hace menos fiable, porque cualquier agente que intente usarlas se encontrará con una puerta cerrada.
Cómo comprobar tu web entera
Lo del Ctrl+U funciona para una página. Para ver todo a la vez hemos publicado una herramienta gratuita que analiza si la IA puede leer tu web: te dice cuántas palabras hay realmente en tu HTML, qué datos estructurados declaras, si estás bloqueando algún bot de búsqueda sin saberlo, y qué archivos de descubrimiento te faltan. Sin registro y sin guardar nada.
Reparte la nota según lo que hoy te cuesta clientes de verdad: la mitad del peso es el contenido legible, y los protocolos emergentes valen el diez por ciento. Nuestra propia web pasa ese mismo análisis, que es lo mínimo que se le puede pedir a quien lo publica.
Preguntas frecuentes
¿Cómo sé si ChatGPT puede leer mi web?
La comprobación más rápida la puedes hacer tú: abre tu web, pulsa Ctrl+U (Cmd+Option+U en Mac) para ver el código fuente y busca con Ctrl+F una frase concreta de tu página. Si la frase aparece, tu contenido está en el HTML y un rastreador puede leerlo. Si no aparece, tu texto lo está montando JavaScript en el navegador y para la mayoría de rastreadores tu página está vacía.
¿Los rastreadores de IA ejecutan JavaScript?
En su mayoría, no. Descargan el HTML que devuelve tu servidor y ahí se quedan. Google sí renderiza JavaScript, pero con retraso y de forma imperfecta. Los rastreadores que alimentan a ChatGPT, Claude o Perplexity son mucho más simples: lo que no esté en la respuesta del servidor, para ellos no existe.
¿Debo bloquear los bots de IA en mi robots.txt?
Depende de cuál, y la diferencia importa mucho. Los bots de búsqueda (OAI-SearchBot, Claude-User, PerplexityBot) leen tu web para citarte con enlace en una respuesta: bloquearlos es renunciar a esas visitas. Los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended, CCBot) usan tu contenido para entrenar modelos, y ahí bloquear es una decisión legítima. El error habitual es bloquear los primeros creyendo que se bloquean los segundos.
¿Qué es llms.txt y hace falta?
Es un archivo de texto en la raíz de tu dominio con un índice en markdown de lo que ofreces, escrito para que lo lea un modelo. Hoy ningún proveedor grande ha confirmado que lo consuma. Cuesta un archivo y sirve para elegir cómo te resumen si algún día se generaliza, así que merece la pena tenerlo, pero quien te lo venda como urgente te está vendiendo humo.
¿Cuánto cuesta poner una web «lista para la IA»?
Lo que de verdad importa cuesta trabajo, no dinero: los archivos de descubrimiento y las reglas de bots son texto plano y se hacen en menos de una hora. Sacar el contenido de detrás de JavaScript sí puede ser un rediseño según cómo esté hecha la web. Lo único que cuesta dinero de verdad son los protocolos de pago para agentes (x402, ACP, UCP), que requieren wallet con criptomonedas o pasarela con comisión, y que no aplican si no vendes online.
¿Sirve de algo esto para posicionar en Google?
Sí, aunque no es el objetivo. Todo lo que hace tu web legible para un modelo la hace también más legible para un buscador: contenido en el HTML, datos estructurados, sitemap correcto y URLs canónicas son requisitos de SEO clásico desde hace años. Lo nuevo no es la técnica, es que ahora hay un segundo tipo de lector al que también le tienes que gustar.
Si prefieres que lo revisemos nosotros, lo dejamos hecho y te explicamos cada cambio. Somos una agencia de desarrollo web en Granada y también hacemos posicionamiento SEO. Puedes empezar pasando tu dominio por el analizador y escribirnos con el resultado.