Diseño web para IA: lo que Google pide, lo que sobra y el método de los datos estructurados fragmentados
¿Cómo lee una IA la web de tu negocio?
Entre los visitantes de tu web hay uno nuevo: los sistemas de IA que leen páginas para responder a tus clientes. Lo hacen en tres pasos, y en ninguno ven tu diseño como lo ves tú. Primero, un rastreador descarga el HTML: Googlebot para Google y, para la búsqueda de ChatGPT, OAI-SearchBot. Después, el sistema recupera los fragmentos que responden a la pregunta. Por último, redacta la respuesta a partir de ellos.
Ese segundo paso es la clave. La investigación sobre sistemas de pregunta-respuesta trabaja con pasajes, no con páginas enteras: el trabajo de Karpukhin y colaboradores (EMNLP 2020) parte de que responder preguntas abiertas «depende de una recuperación eficiente de pasajes». Google aplica una idea parecida desde 2020, cuando empezó a entender pasajes concretos además de la página completa, un cambio que según la propia Google mejoraría el 7% de las búsquedas. Y su IA generativa lanza además consultas derivadas (query fan-out): genera varias búsquedas relacionadas a la vez para reunir más información con la que responder.
Hay un tercer hallazgo que importa al diseñar. En un estudio publicado en Transactions of the Association for Computational Linguistics (Liu et al., 2024), los modelos de lenguaje rendían mejor cuando la información relevante estaba al principio o al final de lo que leían, y empeoraban de forma notable cuando estaba en medio. El estudio mide lo que el modelo recibe, no tu página; pero es una razón más para no enterrar la respuesta.
¿Qué pide Google para que tu web aparezca en sus respuestas de IA?
Menos de lo que se suele pensar. Su guía para las funciones de IA generativa lo resume en un requisito técnico: para poder mostrarse en ellas, una página tiene que estar indexada y poder aparecer en la Búsqueda con fragmento, cumpliendo los requisitos técnicos de siempre. Además, el sitio tiene que estar incluido en las funciones de IA generativa en Search Console. Ese control viene incluido por defecto: lo encuentras en Ajustes › «Search generative AI», y basta con comprobar que nadie lo ha cambiado.
A partir de ahí, lo que decide si la IA entiende tu web es cómo está hecha:
- El contenido, en el HTML que devuelve el servidor. Google renderiza JavaScript, pero aun así recomienda el renderizado en servidor o el prerenderizado, porque hace la web más rápida y porque no todos los bots pueden ejecutar JavaScript. Si tu web solo muestra el texto después de cargar scripts, hay rastreadores que pueden no verlo.
- Párrafos, secciones y encabezados que den una estructura clara. Es, casi literal, lo que recomienda la guía de Google.
- Paso libre a los rastreadores de ChatGPT. OpenAI explica que
OAI-SearchBotsirve para mostrar webs en los resultados de búsqueda de ChatGPT, que las webs que lo bloquean no salen en sus respuestas de búsqueda (aunque pueden aparecer como enlaces de navegación) y recomienda permitirlo en el robots.txt. - Velocidad. Si tu web la generó una herramienta de IA, merece la pena comprobar si pasa los Core Web Vitals.
¿Qué sobra? 4 ideas que la propia Google desmiente
La guía de Google reúne los temas sobre su búsqueda con IA que más circulan por internet y advierte de que muchos de los «trucos» que se proponen no son eficaces ni se apoyan en cómo funciona de verdad su buscador. Tres de estas ideas salen de esa lista; la cuarta, de un cambio que Google anunció en 2023:
1. ¿Hay que «trocear» el contenido para que la IA lo entienda?
No. Google lo dice sin rodeos: no hay ningún requisito de partir el contenido en trozos pequeños para que la IA lo entienda mejor, porque sus sistemas pueden entender varios temas en una misma página y mostrar la parte relevante. Lo que sí funciona es escribir bien: una sección que se entiende sola —que nombra de qué habla en vez de decir «como vimos arriba»— sirve igual a un lector que llega desde Google que a un sistema que recupera ese pasaje suelto. El contenido no se trocea; los datos estructurados, en cambio, sí se fragmentan, y de eso va el método de este artículo.
2. ¿Hace falta un marcado de schema «especial» para la IA?
No. Según la misma guía, los datos estructurados —la descripción de tu negocio en código— no son un requisito para la búsqueda con IA de Google, y no existe ningún marcado de schema.org especial que añadir para ella. Google recomienda seguir usándolos dentro de la estrategia de SEO, porque ayudan a optar a los resultados enriquecidos.
3. ¿Necesito un archivo llms.txt?
Para Google, no. Aun así, es una de las dudas técnicas más buscadas: unas 720 búsquedas al mes en España, casi el doble que «datos estructurados» (Google Keyword Planner, mediana de octubre de 2025 a agosto de 2026). Google dice en su guía que no hace falta crear archivos legibles por máquina, archivos de texto para IA ni marcado especial para aparecer en su búsqueda, y que un LLMS.txt ni ayuda ni perjudica a tu visibilidad en Google, porque lo ignora. Puedes tenerlo para otros sistemas, sabiendo que no es lo que hará que la IA entienda tu negocio.
4. ¿El schema de FAQ sigue dando resultados enriquecidos?
Casi nunca. Desde agosto de 2023, los resultados enriquecidos de preguntas frecuentes solo se muestran en webs gubernamentales y de salud reconocidas. Google aclaró que no hace falta quitar ese marcado: el que no se usa no causa problemas en la Búsqueda, aunque tampoco tiene efecto visible. Nosotros lo mantenemos porque describe las preguntas que la página muestra, sin esperar de él un resultado enriquecido.
¿Qué son los datos estructurados (schema markup) y para qué sirven?
Son una descripción de tu página en un formato que las máquinas leen sin interpretar: «esto es una empresa», «este es su logotipo», «este artículo lo escribe esta persona». Se escriben normalmente en JSON-LD, un formato del W3C, con el vocabulario de schema.org; en inglés es lo que se suele llamar schema markup. Ojo al buscarlo: «datos estructurados» también es un término de ciencia de datos (los que caben en tablas, frente a los «no estructurados»), que no tiene nada que ver con esto.
Google explica que usa los datos estructurados para entender el contenido de la página y para reunir información sobre el mundo, como las personas o las empresas que aparecen en el marcado. En concreto, el marcado de organización le ayuda a desambiguar tu empresa en los resultados: a no confundirla con otra que se llame parecido. Y hay un límite: sus directrices prohíben marcar contenido que no sea visible para quien lee la página.
¿En qué consiste el método de los datos estructurados fragmentados?
Es el método que aplicamos en c6n.eu y que proponemos a nuestros clientes. El nombre es nuestro; la base técnica no: es el estándar JSON-LD 1.1 del W3C. La idea cabe en una frase: tu negocio se describe una sola vez, en un núcleo, y cada página añade solo su fragmento, conectado a ese núcleo.
- Un núcleo de entidad. En la home se declara la empresa —nombre, web, logotipo, perfiles oficiales (
sameAs) y quién está detrás— con un identificador estable, el@id. En nuestro caso,https://c6n.eu/#org. - Un fragmento por página. Cada página describe solo lo suyo —un servicio, un artículo, sus preguntas frecuentes, su miga de pan— y, en lugar de repetir los datos de la empresa, apunta al núcleo con ese
@id. - Lo marcado coincide con lo visible. Si una página no muestra unas preguntas frecuentes, no las declara. Es la regla de Google y además evita que la web «diga» cosas distintas en sitios distintos.
El estándar lo permite de forma explícita: en JSON-LD, una referencia de nodo es un objeto que solo contiene @id y que puede representar un nodo descrito en otro lugar. Así se ve en una página real, este mismo artículo:
// Núcleo, una sola vez (home de c6n.eu, resumido)
{
"@context": "https://schema.org",
"@type": "Organization",
"@id": "https://c6n.eu/#org",
"name": "c6n",
"url": "https://c6n.eu",
"sameAs": ["https://www.linkedin.com/company/c6n-ia/", "https://github.com/c6n-eu"]
}
// Fragmento de esta página (resumido): solo lo suyo, y referencias al núcleo
{
"@context": "https://schema.org",
"@type": "Article",
"headline": "Diseño web para IA: lo que Google pide, lo que sobra…",
"author": { "@id": "https://c6n.eu/#juan" },
"publisher": { "@id": "https://c6n.eu/#org" }
}
| Tipo de página | Fragmento que añade | Cómo enlaza con el núcleo |
|---|---|---|
| Home | El núcleo: Organization (o un subtipo) con @id, logotipo y sameAs | Es el núcleo |
| Servicio | Service con lo que ofreces en esa página | provider → @id de la empresa |
| Artículo o guía | Article con titular y fechas | publisher → empresa · author → @id de la persona |
| Página de autor o equipo | Person con su propio @id | worksFor → empresa |
| Cualquier página con preguntas visibles | FAQPage con esas mismas preguntas | Vive en la página; no hace falta repetir la empresa |
| Todas | BreadcrumbList con la ruta de la página | Describe la posición de la página dentro de la web |
Lo que el método no promete. Google no documenta cómo usa un @id repetido entre páginas, y ya hemos visto que los datos estructurados no son un requisito para su IA. El valor que sí se puede defender con fuentes es este: una descripción de tu negocio única, coherente y sin contradicciones, que ayuda a Google a entender cada página y a no confundir tu empresa con otra. Y cuando cambia algo —un perfil nuevo, un logotipo—, se cambia en un solo sitio.
¿Qué estructura debe tener cada página de una web profesional?
- Una pregunta principal por página, y el
<title>que la nombre: Google usa esa etiqueta como título del resultado en torno al 87% de las veces. - La respuesta en las primeras líneas, con las palabras de tu cliente. Lo demás, después.
- Encabezados que se entiendan solos y, debajo de cada uno, una respuesta directa.
- Datos con su fuente, citas y referencias. En el experimento del estudio original de GEO (Aggarwal et al., KDD 2024), citar fuentes elevó un 115,1% la visibilidad en respuestas de IA de las webs que estaban en 5.ª posición, y en conjunto estas técnicas mejoraron la visibilidad hasta un 40%. Rellenar con palabras clave, en cambio, aportó poco o nada, y con Perplexity rindió un 10% peor que no tocar el texto.
- Quién lo firma y por qué sabe de esto. Google propone evaluar el contenido preguntándose «quién, cómo y por qué»: un autor visible, con su página, responde al «quién».
- Una tabla o una lista cuando hay comparación o pasos. Ordena los datos para quien lee y deja cada dato en su sitio.
Cómo diseñar (o rediseñar) la web de tu negocio para la IA: 8 pasos
- Define tu entidad en una frase: qué haces, para quién y dónde. Es la base del núcleo y de tu home.
- Crea el núcleo en la home:
Organizationcon@idestable, logotipo y perfiles oficiales ensameAs. - Diseña una página por pregunta importante de tus clientes: un servicio, un sector, un precio, una duda frecuente.
- Escribe cada página con la respuesta arriba y secciones que se entiendan solas.
- Añade a cada página su fragmento de datos estructurados, enlazado al núcleo por
@id, y marca solo lo que se ve. - Sirve el contenido en HTML desde el servidor y deja pasar a Googlebot y
OAI-SearchBoten el robots.txt. - Valida los datos estructurados con la prueba de resultados enriquecidos de Google y revisa Search Console.
- Mide si te citan: haz las mismas preguntas a ChatGPT, Perplexity y Google cada cierto tiempo. Nuestro método está en cómo saber si tu empresa aparece en ChatGPT.
Si estás pensando en rehacer la web y quieres saber si te hace falta, el checklist de una web que aparece en Google y en ChatGPT te ayuda a decidir. Y para entender qué cambia entre posicionarse en Google y ser citado por la IA, lee GEO vs SEO.
"Tu web tiene un público nuevo entre sus visitantes, la IA, y es exigente: no lee tu diseño, lee lo que tu web dice de ti. Si cada página lo dice distinto, no sabrá qué creer." — Juan Camilo Calderón, fundador de c6n
Preguntas frecuentes
¿Cómo hacer que la IA recomiende mi negocio?
Nadie puede garantizar que la IA te recomiende, pero sí puedes ponérselo fácil: que tu web sirva el contenido en HTML desde el servidor, que cada página responda una pregunta concreta de tus clientes con la respuesta arriba, que tu negocio esté descrito de forma coherente con datos estructurados y que los rastreadores de Google y de ChatGPT puedan entrar. En el experimento del estudio de GEO de KDD 2024, citar fuentes y añadir datos y citas mejoró la visibilidad en las respuestas de IA; el relleno de palabras clave, no.
¿Qué son los datos estructurados en SEO?
Son una descripción de tu página en un formato que las máquinas leen sin interpretar, normalmente en JSON-LD con el vocabulario de schema.org: qué empresa eres, quién escribe un artículo, qué servicio ofreces. Google los usa para entender el contenido de la página y para desambiguar tu empresa, aunque aclara que no son un requisito para su búsqueda con IA ni existe un marcado especial para ella.
¿Qué es JSON-LD?
JSON-LD es un formato del W3C para escribir datos enlazados en JSON. Es la forma más habitual de añadir datos estructurados a una web. Permite dar a cada cosa un identificador estable con @id y referirse a ella desde otros sitios, que es la base del método de los datos estructurados fragmentados.
¿Qué es llms.txt y lo necesito?
Es un archivo de texto que algunas webs publican para resumir su contenido a los modelos de lenguaje. Para Google no es necesario: su guía dice que no hace falta crear archivos para la IA ni marcado especial, y que un LLMS.txt ni ayuda ni perjudica a tu visibilidad en Google porque lo ignora. Puedes tenerlo para otros sistemas, pero no es lo que hace que la IA entienda tu negocio.
¿Quieres saber cómo lee la IA tu web hoy?
Pídenos el diagnóstico gratuito: revisamos si tu contenido llega en el HTML, cómo está descrita tu empresa en los datos estructurados y si la IA te cita, y te entregamos las prioridades en 48 horas. Mira cómo trabajamos en diseño web y en SEO + GEO.
Hablar con CA.IA — gratisSin compromiso · Máximo 10 clientes activos · c6n.eu
Fuentes
- Karpukhin, V., Oğuz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D. y Yih, W., «Dense Passage Retrieval for Open-Domain Question Answering», Proceedings of EMNLP 2020, revisado por pares. DOI: 10.18653/v1/2020.emnlp-main.550. doi.org
- Liu, N. F., Lin, K., Hewitt, J., Paranjape, A., Bevilacqua, M., Petroni, F. y Liang, P., «Lost in the Middle: How Language Models Use Long Contexts», Transactions of the Association for Computational Linguistics (2024), revisado por pares: rendimiento mayor con la información relevante al principio o al final del contexto. DOI: 10.1162/tacl_a_00638. doi.org
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K. y Deshpande, A., «GEO: Generative Engine Optimization», Proceedings of the 30th ACM SIGKDD Conference (KDD 2024), pp. 5-16, revisado por pares: experimento con el banco de pruebas GEO-bench: hasta +40% de visibilidad; «Cite Sources» +115,1% para webs en 5.ª posición; el relleno de palabras clave aporta poco o nada y con Perplexity rinde un 10% por debajo de la línea base. DOI: 10.1145/3637528.3671900. doi.org
- W3C, «JSON-LD 1.1: A JSON-based Serialization for Linked Data», W3C Recommendation, 16 de julio de 2020: definición de referencia de nodo con
@id. w3.org - Google Search Central, «Google's Guide to Optimizing for Generative AI Features on Google Search»: requisito de estar indexada y poder mostrarse con fragmento, e incluida en el control de Search Console; muchos «trucos» no son eficaces; no hay requisito de trocear el contenido; datos estructurados no requeridos y sin marcado especial; encabezados que estructuran; query fan-out; LLMS.txt ignorado por Google. developers.google.com
- Google Search Central, «Intro to How Structured Data Markup Works»: Google usa los datos estructurados para entender el contenido de la página y reunir información sobre personas, libros o empresas. developers.google.com
- Google Search Central, «Organization Schema Markup»: ayuda a entender los datos administrativos de la organización y a desambiguarla. developers.google.com
- Google Search Central, «General Structured Data Guidelines»: no marcar contenido que no sea visible. developers.google.com
- Google Search Central Blog, «Changes to HowTo and FAQ rich results» (8 de agosto de 2023): rich results de FAQ solo para webs gubernamentales y de salud reconocidas; no hace falta retirar el marcado, que sin uso no causa problemas. developers.google.com
- Google (Prabhakar Raghavan), «How AI is powering a more helpful Google», 15 de octubre de 2020: comprensión de pasajes, que «mejorará el 7% de las búsquedas» al desplegarse. blog.google
- Google Search Central Blog, «More information on how Google generates titles for web page results» (2021): el elemento
<title>se usa en torno al 87% de las veces. developers.google.com - Google Search Central, «Understand JavaScript SEO Basics»: el renderizado en servidor o el prerenderizado sigue siendo buena idea; no todos los bots ejecutan JavaScript. developers.google.com
- Google Search Central, «Creating Helpful, Reliable, People-First Content»: evaluar el contenido con «quién, cómo y por qué». developers.google.com
- OpenAI, «Overview of OpenAI Crawlers»:
OAI-SearchBotsirve para mostrar webs en la búsqueda de ChatGPT; las que lo bloquean no salen en sus respuestas, salvo como enlaces de navegación. platform.openai.com - Search Console, Centro de ayuda, «Search generative AI control»: control de inclusión en las funciones de IA de Google, incluido por defecto. support.google.com
- Elaboración propia de c6n con Google Keyword Planner (España, 2-oct-2026): mediana mensual de octubre de 2025 a agosto de 2026 de «llms txt» (720) y «datos estructurados» (390).