Respuesta corta: los buscadores con IA citan las páginas que pueden recuperar y citar. Una página se cita cuando el rastreador del motor tiene permiso para descargarla, está en el índice en el que busca el motor, encaja bien con la pregunta y contiene un pasaje que responde a la pregunta por sí solo. La reputación de la marca importa, pero solo después de superar esas cuatro puertas.
¿Existe una fórmula publicada?
No. OpenAI, Google, Perplexity, Microsoft y Anthropic no publican cómo ordenan las fuentes dentro de una respuesta, y quien diga conocer los pesos exactos está adivinando. Lo que sí está documentado es la fontanería: qué rastreador alimenta a qué producto y qué hace que una página sea apta. Con eso basta para trabajar, porque la mayoría de las marcas que nunca aparecen citadas fallan en la fontanería, no en la sutil fase de ordenación.
¿Cuáles son las cuatro puertas que debe superar una página?
1. El rastreador correcto debe tener acceso
Cada motor de respuesta lee la web a través de user-agents concretos. La búsqueda de ChatGPT usa OAI-SearchBot; OpenAI indica que los sitios que excluyen a OAI-SearchBot no se mostrarán en las respuestas de la búsqueda de ChatGPT. Perplexity usa PerplexityBot, que según la empresa sirve para mostrar y enlazar sitios web y no se usa para entrenar modelos. La búsqueda de Claude usa Claude-SearchBot. Google AI Overviews forma parte de la Búsqueda de Google, así que depende de Googlebot.
El error habitual es bloquear el bot equivocado. Bloquear GPTBot deja tu contenido fuera del entrenamiento de modelos de OpenAI, pero no te saca de la búsqueda de ChatGPT. Bloquear OAI-SearchBot, sí. Nuestra lista de rastreadores de IA separa los rastreadores de motores de respuesta de los que solo entrenan precisamente por este motivo.
2. La página debe estar en el índice en el que se busca
Los motores de respuesta no leen la web en vivo para cada pregunta. Primero buscan en un índice y luego leen un puñado de resultados. Si tu página no está indexada, por una etiqueta noindex, una canonical equivocada, una cadena de redirecciones o una página que devuelve un error, no se puede recuperar. Para Google AI Overviews, Google indica que una página debe estar indexada y ser apta para mostrarse con un fragmento. No hace falta nada más exótico.
3. La página debe encajar con la pregunta
La recuperación funciona por significado, no solo por palabras clave, pero aun así necesita que el tema se diga con claridad. Una página titulada "Soluciones" con una frase de portada vaga es difícil de relacionar con "mejor app de facturación para autónomos en la UE". Una página cuyo título, encabezados y primer párrafo dicen de qué trata es fácil de relacionar. Esto es SEO on-page clásico, y se ha vuelto más importante, no menos.
4. La página debe contener un pasaje citable
Un motor que ha recuperado tu página todavía tiene que extraer algo de ella. Los pasajes que se citan suelen ser autónomos: un párrafo corto que responde por completo a una pregunta, nombra el tema en lugar de decir "esto" e incluye un dato concreto. Una introducción de 900 palabras que llega a la respuesta en el octavo párrafo no le da al motor nada limpio que citar.
¿Y la autoridad de marca y las menciones?
La autoridad sigue importando. Cuando varias páginas superan las cuatro puertas, los motores tienden a preferir fuentes coherentes y muy referenciadas: una marca que se describe igual en su propio sitio, en directorios y en artículos de terceros inspira más confianza que otra con descripciones contradictorias. Las menciones en otros sitios también crean más páginas que se pueden recuperar para preguntas sobre ti.
Pero la autoridad no compensa una puerta fallida. Una marca conocida cuya página de precios está bloqueada para OAI-SearchBot no será citada en preguntas sobre precios en la búsqueda de ChatGPT, por muy famosa que sea.
¿Cómo se compara esto con el SEO clásico?
| Fase | Búsqueda clásica | Motores de respuesta con IA |
|---|---|---|
| Acceso | Googlebot permitido en robots.txt | El rastreador propio del motor, permitido |
| Índice | Página indexada en Google | Página indexada en el índice de origen del motor |
| Encaje | Título, encabezados, relevancia del contenido | Lo mismo, más una declaración clara del tema |
| Selección | Posición en la página de resultados | Un pasaje citado dentro de la respuesta |
| Resultado | Un clic desde la página de resultados | Un enlace de cita, a veces un clic |
Las tres primeras filas son el mismo trabajo. Las dos últimas cambian lo que significa "buen contenido": una página puede posicionar bien y aun así no ofrecer ningún pasaje digno de cita.
¿Qué puedes comprobar hoy en tu propio sitio?
- Confirma que tu robots.txt permite el acceso a los rastreadores de los motores de respuesta que te interesan. Nuestro comprobador gratuito lo hace en segundos.
- Asegúrate de que las páginas clave son indexables: sin
noindexperdidos, con canonicals correctas y estado 200. - Reescribe la apertura de tus páginas clave para que el primer párrafo responda directamente a la pregunta principal.
- Añade un pasaje autónomo por cada pregunta para la que quieras que te citen.
- Comprueba que tu marca se describe de forma coherente en tu sitio y en tus perfiles principales.
- Haz una comprobación de una página para ver los hallazgos de estructura, schema y preparación para responder de una URL.
Preguntas frecuentes
¿Los motores de IA prefieren a las grandes marcas?
Prefieren fuentes que pueden recuperar y en las que confían. Las grandes marcas superan esas pruebas más a menudo porque están muy indexadas y se mencionan con frecuencia, pero un sitio pequeño con una página clara y citable puede ser citado para una pregunta concreta.
¿Los datos estructurados hacen que los motores de IA te citen?
Ningún proveedor dice que el marcado schema garantice una cita. Los datos estructurados ayudan a las máquinas a entender de qué trata una página, lo que favorece el encaje y la confianza. No sustituyen a un pasaje citable.
¿Cómo sé si me están citando?
Tienes que preguntar a los motores. Haz en ChatGPT, Perplexity y Google las preguntas que hacen tus clientes y apunta qué fuentes aparecen. El seguimiento de ProvenVisible lo hace para un conjunto fijo de prompts cuando lanzas una ejecución; también puedes hacerlo a mano.
