[Jorge J. Rolo en LinkedIn] Optimizas para que la IA te cite, pero caes antes de llegar al generador.

[Jorge J. Rolo en LinkedIn] Optimizas para que la IA te cite, pero caes antes de llegar al generador.

El 9 de agosto se publicó en las actas de KDD 2026 el paper que desmonta el marco mental de casi todo el GEO/AI Search que se vende hoy.

SAGEO Arena montó un pipeline completo de búsqueda generativa, retrieval, reranking y generación, sobre 171.003 documentos reales de 9 dominios, y midió qué pasa en cada etapa al aplicar las tácticas del paper fundacional de GEO.

El resultado: optimizar solo el body text degrada la visibilidad en las tres etapas. Media de -9% en retrieval. AutoGEO, la más agresiva, hunde el documento 22 posiciones.

Reescribes el texto para gustarle al LLM y el documento ni siquiera llega al generador.

Cada etapa premia cosas distintas:
→ Retrieval: premia solape léxico. Optimizar solo los campos estructurales (title, meta description, encabezados, JSON-LD) sube el hit rate un +22% y gana 2,72 posiciones de media.
→ Reranking (cross-encoder): premia responder a la intención, no ampliar el alcance.
→ Generación: la inmensa mayoría de citas salen del body text, no de los campos estructurales.

Estructura y texto no compiten: uno te mete en el pool, el otro te hace citable.

El cullo de botella no es donde crees:

Todas las estrategias degradan el reranking. Todas, con cualquier alcance. El 5,8% de los documentos cayó del puesto 10 al 11 tras optimizar. Fuera del top-10 = fuera del contexto del generador. Da igual lo bueno que sea el contenido.

¿Qué podemos hacer?

  1. Mete entidades, cifras y términos clave en title, meta description, encabezados y JSON-LD. Ahí se decide si entras.
  2. Pon la afirmación principal al inicio del body. Desplazarla a párrafos posteriores hunde el reranking aunque la respuesta siga intacta.
  3. No amplíes el alcance del documento "por si acaso". El reranker lo penaliza.
  4. Sustituye pronombres ambiguos por sujetos explícitos.
  5. Segmenta por dominio: en Shopping, todas las tácticas bajaron la tasa de citación.

Aplicar la misma táctica a las tres etapas es optimizar a ciegas.

Fuentes:
Kim, S., Jeong, W., Kim, S., Lee, S. & Lee, D. (2026).
"SAGEO Arena: A Realistic Environment for Evaluating
Search-Augmented Generative Engine Optimization."
Yonsei University / Konkuk University.
https://arxiv.org/abs/2602.12187

Publicado en KDD 2026, Proceedings V.2, pp. 2342-2353.

Setup del experimento:
- Corpus: 171.003 documentos web reales, 9 dominios
- 2.700 queries (300 por dominio), ~63 documentos candidatos/query
- Pipeline: BM25 (top-100) → Qwen3-Reranker-4B (top-10) → GPT-5-mini
- 10 estrategias de optimización evaluadas, 3 alcances
(solo body text / solo campos estructurales / ambos)

Paper fundacional que se pone a prueba:
Aggarwal, P. et al. (2024). "GEO: Generative Engine
Optimization." KDD '24, pp. 5-16.
https://dl.acm.org/doi/10.1145/3637528.3671900

https://preview.redd.it/6ushst20gdkh1.jpg?width=800&format=pjpg&auto=webp&s=5720dc6134cb1a2d4a3a0405db46dfbb06d31a7a

reddit.com
u/PomberoSEO — 19 hours ago

Hay una URL que te da la voz de cliente real de tu sector, gratis, sin herramientas y en 30 segundos. Y casi nadie en SEO la está usando [por Álvaro Peña de Luna]

Esto lo ha compartido Álvaro Peña en su LinkedIn.

Añade .json al final de cualquier hilo de Reddit.

Así:
reddit.com r/SEO

Se convierte en:
reddit.com r/SEO.json

Y ya está. Sin API key, sin login, sin extensión, sin pagar nada.

¿Y esto qué coño es? ¿Qué te devuelve?

El hilo entero en bruto. Todos los comentarios, todas las respuestas anidadas, y lo que de verdad importa: el campo "ups" de cada comentario.

Ese campo es el oro. Te dice exactamente qué respuestas votó la comunidad como valiosas.

Piénsalo un segundo. En keyword research, tu única señal de demanda es el volumen de búsqueda: cuánta gente escribe algo. Aquí tienes una señal distinta: cuánta gente estuvo de acuerdo con una respuesta concreta.

Eso no lo da ninguna herramienta de SEO.

¿Qué haces con el archivo?

No hace falta que entiendas el código. Copias todo el resultado, lo pegas en tu LLM y le pides tres cosas:

1️⃣ Las 10 respuestas más votadas, ordenadas por "ups", con el texto literal
2️⃣ Las preguntas que se repiten en varios comentarios
3️⃣ Las frases exactas con las que describen su problema, sin reformular

Y ahora la traducción a entregables SEO

➡️ Preguntas que se repiten → brechas de contenido
➡️ Frases literales → long-tail que no está en ninguna herramienta
➡️ Comparaciones entre productos → páginas de comparación que te faltan
➡️ Quejas más votadas → por ahí empieza tu contenido
➡️ Funcionalidades más discutidas → huecos en tus páginas de producto
➡️ Preguntas sin responder → contenido que puedes apropiarte

La aplicación más rápida: coge esas frases y reescribe tus title. Si tu título parece sacado de una lista de keywords, esto lo arregla en 10 minutos.

El truco es de Brian Gorman, recogido en la guía de Reddit para SEO que publicó Ahrefs. Dejo el enlace en el primer comentario.

u/PomberoSEO — 2 days ago

Cómo funciona la marca de agua que pondrán los LLM's en los textos que producen o retocan [por Juan González Villa]

La marca de agua de un LLM no es un carácter invisible que desaparece al pegar como texto plano. Explico cómo funciona realmente y si es posible eliminarla:

  1. En un LLM, la marca de agua es el resultado de aplicar un patrón estadístico a la generación de tokens, que sólo el proveedor del modelo conoce realmente (y si comparte el método, como Google, mantiene secreta la clave para identificar el patrón).

  2. ¿Cómo funciona?

En cada punto en el que el modelo va a generar una nueva palabra (en realidad un token), se toma una ventana del contexto que precede al nuevo token y se combina con una clave secreta. De ahí sale una semilla pseudoaleatoria, que se usa para dividir el vocabulario total en dos grupos de tokens: el grupo verde (el que queremos que nuestro modelo elija) y el grupo rojo.

Cuando no se interviene sobre la elección, cualquier token tiene una probabilidad determinada de ser el elegido, dado un contexto concreto. Esa probabilidad viene dada por el entrenamiento del modelo y su configuración interna (sus pesos y parámetros).

Lo que hacemos ahora es darle a los tokens del grupo verde un pequeño empujón, aumentando levemente sus probabilidades de ser elegidos. Y para decidir qué token va a cada grupo se usa una clave secreta, que sólo conoce el proveedor del modelo.

  1. ¿Son fijos el grupo verde y rojo?

No, si lo fueran sería posible observar desde fuera qué palabras tienden a repetirse más que otras, y el lenguaje generado por ese modelo sería poco natural. Lo que se hace es que por cada contexto diferente, se genera su propio hash y su propia separación del vocabulario en tokens rojos y verdes.

Simplificando mucho: si digo “El próximo eclipse total se producirá…”, el token “en” podría estar en el grupo verde, y si digo “El próximo eclipse de totalidad tendrá lugar…“, el token “en” podría ser rojo.

  1. ¿Degrada la calidad o coherencia del texto aplicar un método de este tipo?

Con una implementación más o menos sencilla como la que acabo de describir, sí, la calidad o naturalidad del texto sería ligeramente menor que si no se interviniera en la elección del token.

Pero existen métodos más complejos que hacen que, en la práctica, el sesgo sea imperceptible. Google Deepmind desarrolló y puso en open source un método llamado SynthID-Text, que le da una vuelta de tuerca al método base (llamado KGW por las siglas de sus autores).

SynthID, en lugar de dividir entre grupo verde y rojo para cada diferente contexto, aplica un método llamado “de torneo”. Se toman múltiples tokens elegidos libremente por el modelo como buenos para ese contexto (sin influir en esa elección) y se emparejan en duelos. Con una clave secreta se generan unas puntuaciones que deciden cuál de los tokens gana el duelo, repitiendo el proceso a lo largo de muchas rondas (generalmente 30).

La marca de agua es la correlación estadística que se va acumulando en el texto entre los tokens elegidos y sus puntuaciones de marca. Por aclarar: esas puntuaciones sólo pueden reconstruirse con la clave secreta que guarda Google, por eso no importa que hayan puesto el método general en open source.

  1. ¿Es realmente imperceptible SynthID-Text?

Google hizo un test A/B en vivo en la app de Gemini, en el que enseñó a los usuarios respuestas con marca y sin marca. Luego analizó el feedback dado a veinte millones de estas respuestas. Conclusión: la tasa de “pulgares arriba” fue 0,01% mayor en las respuestas con marca, y la tasa de pulgares abajo, 0,02% menor. Es decir, no hay un efecto negativo apreciable al aplicar la marca de agua.

  1. ¿Qué método concreto va a usar Anthropic? No lo sabemos exactamente. En su anuncio han hablado de “imperceptible”, y eso me sugiere que van a primar que se preserve la calidad del texto, tal y como hace SynthID.

  2. ¿Todo esto tendría alguna efectividad en textos muy cortos?

La longitud del texto desde luego importa. A más texto, mayores posibilidades de incorporar la marca de agua de manera efectiva.

Y luego está la entropía del texto. Un texto creativo suele tener entropía alta, porque en general la probabilidad de cada posición no está altamente concentrada en unos pocos tokens, sino que se reparte de manera más equitativa entre muchas opciones. Pero no pasa lo mismo en textos de baja entropía, donde el camino hacia el próximo token está fuertemente determinado por el contexto que le precede.

  1. Entonces, ¿qué pasa con el código o con textos de tipo legal?

En teoría, este tipo de textos se prestan peor a una marca de agua que los textos creativos. Pero también para esto hay una posible solución.

En código, no todas las partes del texto tienen la misma entropía. Por ello, se aprovecha para colar la marca de agua en elementos no vitales, como por ejemplo los nombres de las variables o los comentarios, en lugar de los elementos estructurales (como “for”, “in”, etc).

  1. ¿Se puede eliminar la marca de agua si parafraseo el texto generado?

El clásico “espineado” de texto, un método muy usado en SEO antes de que existiesen los LLMs. Pues sí, si el parafraseado y uso de sinónimos es agresivo, podría debilitar o incluso eliminar el rastro de la marca (dependiendo de factores como el método de parafraseado y la longitud del texto).

Se ha visto que combinar “ataques” de léxico y de sintaxis puede ser efectivo. Según el CTO de GPTZero, ya hay herramientas que son capaces de saltarse SynthID.

Pero esto no quiere decir que cualquiera pueda hacerlo, o pueda hacerlo bien. El propio parafraseado necesita ser sofisticado, para no influir negativamente sobre la calidad del texto.

También es cierto que hay métodos de marca de agua más efectivos contra el parafraseo, al trabajar con embeddings (el significado latente del texto, en lugar de las palabras concretas que usas). Quizá Anthropic haya tirado por este lado, pero aún no lo sabemos.

  1. ¿Compartirán los labs su detector con el público?

No lo sabemos. Es un dilema, porque si lo hacen estarían dando facilidades para romper la marca de agua, pero si no lo hacen, limitan la posibilidad de verificación independiente, que es lo que pide la UE.

Google anunció un detector, pero sólo ha dado acceso limitado a organizaciones y publicaciones. Anthropic ha prometido una API, pero creo que el acceso también estará limitado y el coste quizá sea elevado.

En definitiva, creo que veremos una carrera armamentística entre los modelos cerrados y los desarrolladores de herramientas para saltarse sus marcas.

Pero nadie puede garantizar hoy en día que tiene una herramienta que deshace la marca de agua de Anthropic, porque aún nadie ha visto cómo es esa marca.

x.com
u/PomberoSEO — 7 days ago

Anthropic firma el Código de Práctica del AI Act europeo: así va a marcar Claude el contenido generado por IA

Hola, r/ComunidadSEO

Hoy Anthropic publicó un documento que me parece que merece atención más allá del hype habitual. Firmaron el Código de Práctica del Artículo 50(2) del EU AI Act sobre transparencia en contenido generado por IA, y detallaron cómo piensan implementarlo en Claude.

Lo traduzco y resumo porque tiene implicaciones directas para cualquiera que trabaje contenido asistido por IA, estrategias editoriales, o simplemente quiera entender hacia dónde va la regulación europea en este terreno. Y sí, aunque el AI Act es europeo, Anthropic aclara que el marcado aplica globalmente.

¿A qué se comprometió Anthropic exactamente?

  • Los modelos lanzados en la UE a partir del 2 de agosto de 2026 van a incluir marcado legible por máquina desde el día uno. El texto generado llevará watermarks embebidos, y los archivos generados incluirán metadatos de procedencia firmados digitalmente (donde el formato lo permita).
  • El marcado aplica en todos los productos: Claude Platform (API), Claude, Claude Code, Claude Cowork y Claude Tag. También vía AWS, Google Cloud y Microsoft Foundry.
  • Van a publicar documentación técnica para que terceros puedan detectar las marcas de Claude.
  • Los modelos anteriores al 2 de agosto de 2026 están en periodo transitorio. Ya están trabajando en incorporarles el marcado.

¿Cómo funciona el marcado técnicamente?

Dos capas complementarias:

  1. Watermarks embebidos en texto. Cuando un modelo soportado genera texto, teje una marca invisible directamente en la cadena de caracteres. No altera el significado, la calidad ni la legibilidad. Como es parte del propio texto, viaja con él al copiarse y pegarse, y puede sobrevivir a ediciones parciales. Se aplica a nivel de modelo, así que da igual desde qué producto o superficie salga el texto.
  2. Metadatos de procedencia firmados (C2PA). Para archivos como .svg, .png o .jpg, Claude adjunta metadatos firmados que siguen el estándar abierto C2PA (Coalition for Content Provenance and Authenticity). Si el archivo lleva esa etiqueta firmada, indica que fue procesado por Claude y permite detectar si alguien lo manipuló después.

Las limitaciones (esto me parece lo más relevante para nosotros)

El documento es honesto sobre lo que el marcado puede y no puede garantizar:

  • Detectar una marca indica que el contenido puede haber sido procesado por Claude. No confirma autoría original. Alguien puede usar Claude para traducir, resumir, corregir o reformatear un texto propio, y el output llevará marca aunque la idea y los datos sean humanos.
  • El contenido puede modificarse después del procesamiento por Claude: recortarse, mezclarse con otro material, editarse parcialmente.
  • La ausencia de marca no significa que el contenido no sea IA. Puede deberse a: modelo anterior al marcado, texto muy editado o parafraseado después, pasajes demasiado cortos para señal fiable, metadatos eliminados por conversión de formato o captura de pantalla, o plataformas/formatos donde cierto tipo de marcado no está soportado.

Para los que integran Claude en productos propios

Anthropic recuerda que cada deployer tiene que evaluar independientemente qué le exige el Artículo 50. Ellos van a publicar guías técnicas de marcado y detección para ayudar a cumplir obligaciones propias.

¿Por qué me importa esto como SEO?

Varias razones prácticas:

  • Google lleva desde el Helpful Content System diciendo que evalúa contenido por su utilidad y experiencia demostrada (E-E-A-T), no por si fue generado con IA o por un humano. Pero el hecho de que la regulación europea fuerce marcas legibles por máquina abre la puerta a que buscadores, plataformas y herramientas de terceros puedan identificar y segmentar contenido asistido por IA a escala.
  • Si gestionáis contenido asistido por Claude para clientes, conviene entender que ese texto ya va a llevar marca embebida. Esto no es un "detector de plagio" ni afecta al ranking per se hoy, pero el ecosistema de señales de procedencia está creciendo (C2PA ya lo usan Adobe, Microsoft, Google, BBC...).
  • La transparencia regulatoria va a presionar a todos los proveedores de modelos. OpenAI, Mistral y demás van a tener que moverse en la misma dirección para cumplir el Código. El estándar C2PA probablemente se consolide como la capa de autenticación de contenido digital.
  • Para estrategias de contenido: esto refuerza la importancia de que la autoría humana, la experiencia de primera mano y la supervisión editorial queden documentadas. El watermark dice "pasó por Claude". Lo que no dice es quién lo pensó, quién lo editó ni quién lo publicó. Esa capa sigue siendo responsabilidad del editor.

Fuente original: blog de Anthropic, publicado hoy. Si queréis el enlace directo lo dejo en comentarios.

reddit.com
u/PomberoSEO — 9 days ago

Search Console está mostrando el rendimiento para Funciones de IA generativa. Por ahora, muestra impresiones

Hoy encontré algo muy interesante en Search Console

Google está testeando mostrar datos sobre IA generativa para los sitios. Hasta ahora muestra impresiones, y a qué páginas corresponde.

También permite filtrar por países, dispositivos y semanas.

Ya era hora de que empiecen a brindar un poco más de claridad. Si utilizan la información de los sitios para esos resúmenes de IA, por lo menos deberían dar indicios de qué contenido es el que están citando o mencionando y para qué búsquedas.

Espero ansiosamente eso, que indiquen las búsquedas que disparan esas impresiones.

¿Alguien ya lo vio también?

https://preview.redd.it/528tfvk9dkih1.png?width=1200&format=png&auto=webp&s=93247fbd4be9db4cfb014633efa90529d44b77c4

reddit.com
u/PomberoSEO — 10 days ago

¿Qué tipo de contenido sigue valiendo la pena crear cuando las plataformas de IA pueden responder consultas sin enviar un solo clic? [por Aleyda Solís]

Para traducir esto en algo accionable que pueda compartir con mis clientes, creé un framework de priorización de contenidos adaptado a la era de la búsqueda con IA. Tiene en cuenta la razón por la que un usuario seguiría visitando ese contenido, su valor propietario y su conexión con los resultados de negocio.

El framework utiliza seis dimensiones direccionales que sirven para evaluar opciones de inversión y luego repriorizarlas en función de los usuarios reales del sitio, los prompts prioritarios, el rendimiento y el modelo de negocio.

Contenido recomendado para priorizar:

  1. Páginas de marca y de entidad
  2. Páginas transaccionales y de finalización de tareas
  3. Documentación oficial de producto, especificaciones y políticas
  4. Tests de producto en primera persona y reseñas de rendimiento
  5. Investigación original de mercado, audiencia y patrones de uso
  6. Bases de datos live de primera parte y hubs de referencia
  7. Resultados de clientes documentados, experimentos y casos de estudio
  8. Guías de implementación y resolución de problemas específicas por producto
  9. Comparativas y guías de selección basadas en evidencia
  10. Herramientas personalizadas que utilizan datos live o propietarios
  11. Conocimiento curado de comunidad y profesionales del sector
  12. Reporteo original y análisis de fuentes
  13. Páginas escalables con insights genuinos y útiles, alimentadas por datos únicos de primera parte

Contenido recomendado para despriorizar:

  1. Definiciones genéricas aisladas, sin contexto de marca ni de journey
  2. Explicaciones y guías how-to recicladas sin valor original
  3. Páginas FAQ fragmentadas y variantes de keyword que responden a una sola intención
  4. Reescrituras de noticias de terceros y notas de prensa sin aporte propio
  5. Temas tangenciales de alto volumen sin un recorrido de negocio creíble
  6. Páginas sesgadas o producidas en masa de tipo "mejores", comparativas y alternativas
  7. Calculadoras, quizzes y generadores genéricos sin inputs diferenciadores
  8. Páginas programáticas construidas a partir de datos públicos o de competidores

Como se puede ver, muchas veces el problema no está en el formato en sí, sino en cómo se ejecuta y si ofrece una razón real para ser visitado, citado o asociado con la marca.

Más información en el enlace de los comentarios, donde también pueden acceder al framework y a la hoja de trabajo 👀

reddit.com
u/PomberoSEO — 13 days ago

Cómo utilizar bien Google Search Console

¿Tu web no despega en Google y no sabes por qué?
En este vídeo te enseño cómo usar Google Search Console correctamente en 2026 para entender cómo te ve Google, detectar errores SEO y mejorar posiciones paso a paso.

Soy Josep Deulofeu, consultor SEO especializado en eCommerce en VisibilidadON, y en los últimos 5 años he ayudado a más de 400 tiendas online a ganar visibilidad en Google gracias al SEO y Google Ads.

En esta guía clara y sin tecnicismos, te explico cómo utilizamos Google Search Console en agencia para diagnosticar un proyecto, definir una estrategia SEO y crear un plan de acción real usando la metodología OADEP.

En este vídeo aprenderás:
✅ Cómo configurar Google Search Console correctamente
✅ Qué palabras clave ya te están trayendo tráfico
✅ Cómo interpretar clics, impresiones, CTR y posición media
✅ Cómo detectar errores de indexación y SEO técnico
✅ Cómo usar la inspección de URLs para indexar contenido nuevo
✅ Cómo aprovechar Search Console para SEO eCommerce y Google Shopping

Google Search Console puede parecer técnica, pero bien usada es tu mejor aliada para mejorar tu SEO cada semana.

youtube.com
u/PomberoSEO — 14 days ago

Otra tool de Query Fan Out que puede ser útil para monitorear nuestro desempeño en la IA

Cada prompt (o instrucción) que le das a ChatGPT se divide en un montón de búsquedas separadas que se ejecutan en segundo plano. Las famosas Query Fan Out.

Lee docenas de páginas y cita algunas de ellas. Esas búsquedas ocultas deciden quién aparece en la respuesta, y normalmente nunca llegas a verlas.

Nati Elimelech ha creado una extensión de Chrome que ayuda a ver esto muy claramente, para poder observar qué tal es el desempeño de nuestra marca.

Esta extensión permite hacer lo siguiente:

✅ Ver las búsquedas exactas que ejecuta ChatGPT detrás de cada respuesta.

✅ Ver cada página que leyó, agrupada por dominio, y si fue citada o leída pero omitida.

✅ Ver qué páginas lograron formar parte de la respuesta (¡ser leído no es lo mismo que ser citado!).

✅ Volver atrás y navegar: cada captura se guarda por conversación, con un enlace que te devuelve al chat.

✅ Copiar cualquier consulta o URL, o exportar todo como CSV o JSON.

✅ Privado, no rastrea, no guarda datos, no muestra ads.

Lo comparto porque considero que herramientas así hacen más fácil nuestro día a día.

Dejo el enlace en los comentarios

reddit.com
u/PomberoSEO — 17 days ago

Repunte gigante en citas de AI Mode hacia propiedades de Google (GBP y Product Cards)

Era cuestión de tiempo. Google ha registrado un repunte gigante en las citas de AI Mode y ahora está enlazando de forma directa a los GBP y a las Product Cards.

Los datos salen de un estudio de Davis McCain en Profound, compartido por Mark Williams-Cook en su newsletter. Analizaron las citas de AI Mode entre abril y junio. A mediados de mayo, Google empezó a enlazar muchísimo más a propiedades de su propio ecosistema.

El grueso del incremento proviene de los GBP y las Product Cards. Las rutas de URL más afectadas fueron /searchviewer/ y /search, que es donde residen estos directorios. El estudio ni siquiera incluye a YouTube, plataforma que seguramente los consolidaría como la fuente absoluta de citas en AIO y AI Mode.

Ya vimos este movimiento en el buscador tradicional y era lógico que llegara a la inteligencia artificial. Para competir en el ecosistema de Google, hay que integrar el contenido directamente en sus suites de productos.

Esta es la URL del estudio original: https://www.tryprofound.com/blog/google-com-is-now-ai-mode-s-2-cited-domain

u/PomberoSEO — 1 month ago

Frescura como señal de cita: no es la fecha, es el cambio sustantivo [por Jorge J. Rolo]

Los LLMs citan contenido 25,7% más fresco, más reciente, más actualizado pero no por tocar la fecha.

Seguro que has escuchado eso de: "actualiza la fecha del post y ChatGPT te citará más".
El dato real (y trazable) es otro.

Ahrefs analizó casi 17 millones de URLs citadas en 7 superficies (ChatGPT, Perplexity, Gemini, Copilot, AI Overviews y SERP organica), qué encontró:

→ Lo que cita la IA es un 25,7% más fresco que lo que rankea en organico (1.064 días de media vs 1.432).
→ ChatGPT es el mas sesgado a lo nuevo: cita paginas de 958 dias de media. → Google AI Overviews es la excepcion: cita contenido 16 dias MAS VIEJO que el orgánico.
→ Perplexity y ChatGPT ordenan sus citas de mas nueva a mas vieja. La frescura no es solo ranking: es señal de presentacion.

Pero aqui esta el matiz que casi nadie cuenta:
La palanca no es el dateModified, es el cambio sustantivo.
Google lo dice en su propia doc: usa múltiples señales para la fecha (visible + datos estructurados) y avisa de no "refrescar artificialmente" una pagina sin añadir información significativa. La recuperación de IA puntua pasajes del cuerpo, no el campo de fecha. Cambiar el timestamp sin tocar el texto no te da citas; y encima puede levantar bandera.

¿Que debemos hacer?

  1. Refresca lo que mueve negocio (precios, comparativas, datos, regulación), no todo el blog. Ahí es donde "la respuesta ha cambiado".
  2. Refresco real: 20-30% de cuerpo nuevo + un dato o fuente actual por sección. No solo la fecha.
  3. Coherencia total: fecha visible = dateModified en JSON-LD (ISO 8601). Si no cuadran, Google elige la que quiere.
  4. Perplexity y ChatGPT premian cadencia, no un evento. Mensual en tus paginas top; trimestral en el resto.

La media de lo citado sigue siendo 2,9 años. La IA también prefiere contenido con recorrido. Y Google (donde sigue la mayoría de búsquedas) es el menos sensible a la frescura. A veces crear contenido nuevo rinde mas que actualizar como un poseso.

La frescura no es la fecha, sino que la información siga siendo cierta.

Vía: Jorge J. Rolo

reddit.com
u/PomberoSEO — 1 month ago

Cómo usar Google Search Console: guía práctica [por Cristóbal Cazor]

Todavía hay profesionales que reportan la posición media de Search Console como si fuera el ranking real de una keyword. 🥴

La posición media es un promedio de promedios.

Un 8,0 puede ser una página que siempre aparece octava, o una que a veces aparece primera y otras veces en la página tres.

El mismo promedio puede esconder comportamientos completamente distintos. Y si no entiendes esa diferencia, también puedes terminar tomando decisiones equivocadas.

Y la ironía es grande: Search Console es la única herramienta que entrega datos directos sobre el rendimiento de tu sitio en Google.
Ahrefs, Semrush y los rank trackers reconstruyen desde afuera lo que GSC mide desde adentro.

Datos de primera fuente, gratis.

Y, aun así, es una de las herramientas peor leídas del stack.

Por eso escribí una guía para leer Search Console y sacarle el máximo provecho: encontrar quick wins, detectar canibalización, diagnosticar problemas de indexación, ver el HTML que Googlebot recibe realmente al renderizar una página y aprender a utilizar toda esa información a tu favor.

Incluí también un complemento que le da superpoderes a la interfaz y que, desde que lo descubrí, hizo que ya no pudiera imaginar GSC sin él.

La dejo acá: https://cristobalcazor.com/blog/como-usar-google-search-console

u/PomberoSEO — 1 month ago
▲ 4 r/ComunidadSEO+1 crossposts

La consola de Chrome y sus usos en posicionamiento web

Este artículo de Carlos Sánchez Donate es muy úitl para comenzar a sacar provecho de la consola de Chrome para el SEO. Allí encontraremos datos interesantísimos sin necesidad de pagar ninguna herramienta. Solo es entrenar el ojo para ver.

carlossanchezdonate.com
u/PomberoSEO — 1 month ago

Sobre el chunking y qué tiene de efectivo [por Suganthan Mohanadasan]

Sé que el "chunking" es un tema controvertido en el SEO para IA. Pero creo que la gente está confundiendo dos cosas distintas.

Los LLMs pueden entender lenguaje natural.

El problema normalmente no es el modelo leyendo tu contenido.

El problema es lo que se rastrea, parsea, extrae, indexa y recupera antes de que el modelo siquiera lo vea.

Mientras analizaba el tráfico de red de Gemini, encontré un esquema fuente llamado snippet_extract.

Cada vez que Gemini fundamentaba una respuesta con una fuente, extraía un pequeño fragmento del cuerpo real de la página, normalmente de entre 50 y 250 caracteres o más.

Eso no significa que necesites escribir contenido robótico para máquinas. Significa que el fragmento recuperado de tu página necesita responder la pregunta de forma clara. Esa es la clave.

Si tu página responde a una pregunta específica, haz que la respuesta sea absurdamente clara.

Coloca una respuesta corta y directa cerca del inicio de la sección relevante. Apunta a entre 50 y 250 caracteres sin relleno ni teatro SEO. Simplemente responde la pregunta de la forma más limpia posible.

No necesitas sobredimensionar toda tu página ni convertir cada artículo en un conjunto extraño de fragmentos artificiales.

El buen SEO tradicional sigue funcionando.

La diferencia ahora es que los sistemas de recuperación pueden extraer solo un pequeño fragmento de tu página.

Así que asegúrate de que el fragmento correcto exista.

No existe eso de "escribir para máquinas".

Se trata de escribir con suficiente claridad para que tanto humanos como sistemas de recuperación puedan encontrar la respuesta.

Y sinceramente, eso es lo que el buen SEO debería haber sido desde siempre.

Vía: Suganthan Mohanadasan

reddit.com
u/PomberoSEO — 1 month ago

Si tu sitio usa Cloudflare, debes tener cuidado de configurarlo bien antes del 15 de septiembre

¿Tu sitio web está protegido por Cloudflare?

Si es así, ve a Seguridad -> Configuración -> Configurar políticas de bots de IA.

En la sección "Entrenamiento", asegúrate de que esté seleccionada la opción "Permitir (no bloquear)".

Haz esto antes del 15 de septiembre.

A partir de esa fecha, si has seleccionado la opción de bloquear el entrenamiento, Cloudflare bloqueará los rastreadores multipropósito (especialmente aquellos que combinan búsqueda con entrenamiento), como Googlebot, Applebot y Bingbot.

Esto perjudicará tu posicionamiento SEO, así que no lo dejes sin configurar a tu gusto.

reddit.com
u/PomberoSEO — 2 months ago

Suganthan Mohanadasan analizó el tráfico crudo de ChatGPT y reveló cómo elige sus fuentes (y por qué ignora tu web)

TL;DR: ChatGPT no es magia, es un scraper gigante. Si tu web es lenta, está llena de JavaScript que oculta el texto, o tu contenido no es texto plano, el modelo se rinde, se da la vuelta y cita a Reddit o a tus competidores en foros. Si quieres que te cite, pon la información importante en HTML plano y texto directo.

Un desarrollador (Suganthan Mohanadasan) no se limitó a mirar las respuestas de ChatGPT para adivinar cómo funciona. Hizo algo mucho más interesante: inspeccionó el tráfico de red crudo (el JSON que viaja entre tu navegador y los servidores de OpenAI) para ver qué pasa literalmente "detrás de escena".

Aquí está el resumen de lo que descubrió

1. OpenAI tiene diferentes "espías" para leer la web

ChatGPT no usa una sola herramienta para buscar. Dependiendo de lo que preguntes, usa distintos pipelines de rastreo:

  • labrador: Es el VIP. Lo usa para medios con los que tienen acuerdos de licencia (Reuters, WSJ, Wikipedia). Les permite leer textos súper largos.
  • bright y oxylabs: Son empresas de scraping comercial. Las usa para cosas transaccionales, finanzas, clima y... foros como Reddit.
  • serp: Es su búsqueda web básica, mayormente para noticias.

2. A veces NO te busca (El peligro del modo "text")

Antes de buscar en internet, ChatGPT clasifica tu pregunta. Si decide que es una pregunta genérica, de definición, o si la redactas de forma que el modelo cree que "ya sabe la respuesta", entra en un modo llamado text.
El problema: En este modo, no ejecuta ninguna búsqueda web. Responde 100% con su memoria de entrenamiento. Si tu web no es súper famosa, simplemente no existes para esa respuesta.

3. Busca como un maniático (y lee el código HTML)

Para preguntas complejas, ChatGPT no hace una sola búsqueda. Lanza entre 15 y 40 sub-búsquedas.
Lo más loco es que a veces busca cosas literales en el código de tu web. Por ejemplo, para encontrar precios, el modelo busca el símbolo de $ o directamente en el HTML.
El gran fallo: Si tus precios, tablas o datos están renderizados con JavaScript pesado o metidos en una imagen, el modelo no los va a ver.

4. Por qué Reddit gana tanto (y YouTube pierde)

  • Reddit: Es texto plano. El modelo lo lee facilísimo, por eso lo cita tanto en casi todo.
  • YouTube: ChatGPT puede "ver" que existe un video (lee título y descripción), pero casi nunca lo cita porque no puede ver el video ni procesar la transcripción fácilmente.
  • La regla de oro: ChatGPT deduplica por dominio. Si tienes 20 artículos en tu blog sobre el mismo tema, el modelo los colapsa. Solo va a citar una URL por dominio.

5. ChatGPT "habla solo" cuando se frustra

El modelo tiene un "pensamiento en voz alta" (Chain of Thought). Si intenta leer tu página de precios y falla porque está muy cargada de JS, el modelo se dice a sí mismo en su código: "No puedo leer los precios, probablemente están ocultos por JS".
¿Y qué hace entonces? Hace un fallback y busca los precios en G2, Capterra, foros o webs de reseñas.

Básicamente, si tu web es difícil de leer, le estás regalando la cita a tu competencia o a Reddit.

reddit.com
u/PomberoSEO — 2 months ago

Sitio que había sido golpeado por Google ahora tiene un 10000% más de visibilidad [via Chris Long]

¡No puedo creer lo que ven mis ojos, expertos en SEO! HouseFresh, el sitio que criticó duramente a Google por perjudicar a los pequeños editores, ¡se ha recuperado en un +10.000%!

Esta es una historia bastante increíble que ha cobrado fuerza. Hace casi exactamente dos años, HouseFresh publicó un artículo sobre cómo Google estaba acabando con los medios independientes. Fue noticia en su momento. Creo que Rand Fishkin, Lily Ray y Cyrus S. hablaron de ello, ¿no? Probablemente muchos más.

Sé que ha habido muchas quejas sobre los resultados de búsqueda en los últimos años, pero este es un ámbito en el que Google parece estar acertando de nuevo. Los sitios que invierten en contenido original, reseñan productos y se esfuerzan están siendo recompensados.

La semana pasada publiqué que cada vez veía más sitios como este recibir premios en los resultados de búsqueda. Pues bien, este es probablemente el ejemplo más épico hasta la fecha. El sitio que fue noticia hace dos años ha vuelto, y con toda razón.

Fuente: Chris Long

reddit.com
u/PomberoSEO — 2 months ago

Hoy se lanzó el Spam Update de Junio. Suerte, caballeros.

Hoy lanzamos la actualización de junio de 2026 para eliminar el spam en la Búsqueda de Google.

Esta es una actualización normal para eliminar el spam y se implementará en todos los idiomas y ubicaciones. La implementación puede tardar algunos días en completarse. Puedes encontrar más información sobre las actualizaciones para eliminar el spam en

https://status.search.google.com/incidents/YUX1peHev5a4fkxLDiUQ

reddit.com
u/PomberoSEO — 2 months ago