Google ha presentado Imagen 4Su modelo más avanzado de inteligencia artificial para la generación de imágenes a partir de descripciones textuales, disponible a partir de hoy en versión preliminar para desarrolladores a través de la API de Gemini y en la plataforma de Google Para estudiar.
Este lanzamiento, anunciado en el blog oficial para los desarrolladores de Google, representa un salto relevante en la evolución de la tecnología de «texto de imagen», al abordar uno de los desafíos más persistentes en el sector: la integración precisa y legible del texto dentro de las imágenes generadas por AI.
La llegada de la imagen 4 responde a una creciente demanda de herramientas capaces de producir imágenes fotorrealistas y coherentes, especialmente en contextos donde la combinación de elementos visuales y textuales es esencial.
Imagen generada con la imagen 4. (Desarrolladores Blog de Google)
Hasta ahora, los modelos de inteligencia artificial enfrentaban limitaciones notables al tratar de representar el texto dentro de las imágenes, lo que generaba resultados con errores de ortografía, inconsistencias formales o una integración deficiente en carteles, logotipos y etiquetas.
La imagen 4 introduce mejoras en la representación de texto
La imagen responsable de la imagen 4, compuesta por los gerentes de productos Alisafortin y Seth Odoom, junto al desarrollador defensor Guillaume Vernade, ha subrayado en el anuncio de que el nuevo modelo presenta «Mejoras significativas en la representación de texto» Con respecto a las versiones anteriores.
Esta declaración implica que los usuarios pueden describir escenas que incluyen frases, nombres o mensajes específicos, y obtener imágenes en las que el texto aparece correctamente escrito e integrado visualmente.
La mejora en la representación del texto se traduce en un problema mucho mayor de que el resultado es correcto y estéticamente integrado, lo que representa un avance para aquellos que dependen de la precisión en la presentación de mensajes escritos dentro de las imágenes.
Imagen original de la creación de Google 4.
La capacidad de generar texto legible dentro de las imágenes amplía el espectro de posibles aplicaciones, lo que permite desde la creación de material publicitario personalizado hasta la elaboración de prototipos de productos con etiquetas realistas, a través de ilustraciones para medios editoriales que requieren mensajes claros y precisos.
Es pertinente señalar que la tecnología de «texto de imagen» se basa en la posibilidad de que cualquier usuario describe una escena con palabras y reciba una representación visual generada por la inteligencia artificial.
El anuncio de Google posiciona en la imagen 4 como su «mejor modelo de texto hasta la fecha», una declaración que refleja la intención de la compañía de competir directamente con otras soluciones líderes en el mercado, como Intermediario Y De 3 de OpenAi.
Google ha presentado la imagen 4, su modelo más avanzado de inteligencia artificial para la generación de imágenes a partir de descripciones textuales. Reuters/dada ruvic/ilustración/foto
Estas plataformas han marcado una tendencia en la generación de imágenes a través de la inteligencia artificial, pero la capacidad de producir texto legible y coherente dentro de las imágenes sigue siendo un diferenciador clave.
Disponibilidad y tarifas para desarrolladores y creadores
La imagen 4 está actualmente disponible en un modo de «vista previa del pago» a través del Agua de gémica. Esta opción permite a los desarrolladores incorporar el modelo en diferentes servicios y sus propias aplicaciones. Además, Google AI Studio ofrece acceso a pruebas gratuitas limitadas, proporcionando a los usuarios la posibilidad de interactuar y experimentar con el modelo del modelo desde un entorno web.
El esquema de precios comienza desde un costo para cada imagen generada. Según la información de la API de Gemini, El valor para generar una imagen con la imagen 4 es 0.04 dólaresmientras que la versión Ultra tiene un precio de $ 0.06 por imagen.
Google informó que se agregarán nuevos niveles de facturación en las próximas semanas. También aclaró que los desarrolladores que requieren una mayor capacidad de generación de imágenes pueden solicitar la expansión de sus límites de uso.


