Vibe codifiqué una aplicación con 3 chatbots populares. El verdadero ganador es un buen aviso

Si puedes escribir o hablar, probablemente puedas código de vibra. Es realmente así de fácil. Simplemente comunica tu idea al chatbot de IA de su elección con lenguaje natural y se pondrá a trabajar. Si bien es posible que no todos los proyectos terminen siendo una joya o incluso completamente funcionales, el esfuerzo que implica crear una aplicación web simplemente chateando es mínimo.

He jugado bastante con la codificación vibe, creando proyectos aleatorios aquí y allá. Lo he probado principalmente como prueba de concepto o simplemente con fines de prueba de chatbot, pero rara vez en un intento de hacer algo crucial o funcional hasta el punto de verme usándolo a diario. Luego comencé a buscar un dispositivo de lectura electrónica y me fui frustrado por lo increíblemente «tontos» que son la mayoría de ellos, especialmente los Kindles. Más sobre eso más adelante.

Independientemente de la motivación (pero sobre todo desafiando a Amazon), me impulsó a intentar crear una solución en el código, pero con un giro. Quería ver si podía codificar una aplicación de lectura electrónica funcional con todas las funciones que quería. Sabiendo que incluso si tuviera esto en funcionamiento, probablemente no lo usaría a diario, pero quería agregar algo de estilo.

La pregunta fue qué chatbot de IA utilizar. No me molesté en intentar elegir. Utilicé Gemini, Claude y ChatGPT para crear lo que quería y luego ver si alguno producía mejores resultados.

el aviso

Es difícil comparar chatbots, especialmente cuando se intenta imitar la misma conversación o proyecto de codificación de vibraciones. Créeme, lo he intentado. Quería asegurarme de que todas las herramientas que probé usaran el mismo mensaje, pero primero quería perfeccionar ese mensaje para obtener los mejores resultados, así que se me ocurrió una estrategia para llegar allí.

Primero, construí todo el proyecto en su nivel más básico con Gemini. Una vez que me gustó dónde estaba el proyecto (prueba de concepto funcional y exitosa), le pedí que creara un mensaje para poder agregarlo a cualquier otro chatbot. Gemini generó el mensaje, lo guardé como un archivo y se lo subí a Claude. Pasé por este proceso nuevamente, lo que le permitió a Claude detectar y arreglar cosas en las que no había pensado al construir el proyecto y Gemini. Una vez que se completó el proceso, le pedí que creara otro mensaje para poder agregarlo a ChatGPT.

La idea era que los tres chatbots tuvieran alguna aportación sobre la creación real del proyecto y, a su vez, el mensaje final. Una vez que se creó el mensaje, lo cargué en los tres chatbots en un chat separado para ver qué tan consistente se desempeñaban.

El proyecto: El lector de tomos

Este proyecto nació de mi frustración con los dispositivos Kindle de Amazon. Cualquiera a quien le guste leer y escuchar sus libros puede hacerlo resaltando en tiempo real en la aplicación para iOS o Android, pero después de todo este tiempo (casi 20 años) no se puede hacer esto en un Kindle. De hecho, no hace mucho que los usuarios obtuvieron la capacidad de lograr resaltado de texto en tiempo real mientras se reproduce el lector de asistencia, que está muy cerca de la funcionalidad de la aplicación. A partir de ahora, sólo puedes leer o escuchar un audiolibro en Kindle, no ambos, lo cual es ridículo, al igual que la idea de que Amazon fuera dueño de todos mis libros. Me puse a pensar que podría simplemente codificar una solución. Yo lo llamo el lector de tomos.

Quería crear una aplicación web de lectura electrónica inmersiva que le leyera sus libros en voz alta (con texto resaltado en tiempo real, por supuesto) ya sea que el texto estuviera pegado o que se hubiera subido su propio archivo PDF o EPUB. Además de leer el texto en voz alta, la aplicación web crearía música de fondo dependiendo del contenido del texto en un subconjunto de categorías (neutral, horror gótico, ciencia ficción, naturaleza, fantasía, submarino, western, misterio) y generaría efectos visuales y sonoros adicionales cuando ciertas palabras desencadenantes se pronunciaran en tiempo real. Todo el proyecto se creó en un único archivo HTML para que pudiera ejecutarse en un navegador web sin dependencias adicionales.

Construyendo con los chatbots: la primera ronda

Géminis

Gemini creó todas las funciones que quería del Tomb Reader con relativa facilidad.

Google/Captura de pantalla de Blake Stimac

Gemini me permitió descubrir hasta dónde podía ampliar la función de esta aplicación web y, por lo tanto, la mayoría de su funcionalidad proviene del chatbot de Google. Me permitió solucionar algunos pequeños problemas al principio, lo que impidió que se cargaran las voces TTS. En cambio, creó una pantalla de inicialización que obligaría a que las voces se cargaran después de hacer clic en una pantalla «abrir» de la aplicación. Sin este tipo de conocimientos, el proyecto no habría despegado.

Poco a poco, la funcionalidad del proyecto empezó a crecer. Debido a que los efectos de sonido en vivo para ciertas palabras pueden distraer, me aseguré de agregar la opción para desactivar esos efectos de sonido y la música de fondo. Después de tener una base de la aplicación funcionando, le pedí a Gemini que creara un mensaje que pudiera compartir con otros chatbots para poder crearlo en otro lugar si quería, y eso fue lo que hizo.

claudio

El proyecto de Claude me dio el mayor éxito en algunas áreas y más problemas en otras, pero es mi favorito personal de los tres proyectos de prueba.

Antrópico/Captura de pantalla de Blake Stimac

Claude hizo fantásticos refinamientos en la función subyacente de las palabras desencadenantes en este proyecto. Claude amplió el vocabulario y aumentó la visualización cuando se pronunciaba en voz alta una palabra desencadenante. Dicho esto, Claude hizo una llamada que yo no le pedí, aunque la lógica tenía sentido.
Inicialmente, pensé que el proyecto no estaba funcionando porque cuando fui a probar su funcionalidad, solo la primera palabra desencadenante crearía el efecto deseado en una cadena de casi 10. Claude tardó algún tiempo en revelar finalmente que había decidido permitir que los efectos visuales y de sonido solo se activaran una vez por oración para no enviar «spam» al usuario. Esto tenía mucho sentido, pero el proyecto era más una prueba de concepto que un lector funcional, y Gemini y ChatGPT generaron efectos de sonido para cada palabra clave, que era la funcionalidad esperada.

Dicho todo esto, no había instrucciones específicas dentro del mensaje para la cantidad de veces que se reprodujeron los efectos visuales y de sonido. Si bien no era necesariamente lo que quería, aprecié la consideración de la experiencia general del usuario al realizar tal llamada. Luego, después de codificar todas esas mejoras, Claude actualizó el mensaje y lo llevé conmigo a ChatGPT.

ChatGPT

ChatGPT no pudo crear funciones adicionales cuando se lo pedí en ocasiones, pero aún así logró recrear el proyecto perfectamente cuando le di el mensaje final.

OpenAI/Captura de pantalla de Blake Stimac

Cuando creé el mensaje actualizado con Claude, no se me ocurrió mucho más cuando lo subí a ChatGPT. Afortunadamente, el chatbot de OpenAI creó el proyecto con facilidad, a pesar de ser el más lento a la hora de generar el código. La única función que le pedí a ChatGPT que agregara al proyecto (crear un control deslizante de volumen dedicado para la música de fondo para que pudiera apagarse por completo si uno solo quería una experiencia de lectura electrónica dedicada) falló constantemente. Finalmente, volví a Claude para pedirle esta funcionalidad y recrear el mensaje.

Ronda 2: Recreando el mismo proyecto

A pesar de usar Gemini 3 Pro para construir inicialmente el proyecto y las versiones gratuitas de ChatGPT y Claude, los tres crearon el proyecto, pero no sin problemas. Pasé la mayor parte de mi tiempo con Claude perfeccionando el proyecto y él era responsable de crear la versión final. Así que fue increíblemente sorprendente descubrir que al cargar ese mensaje en un nuevo chat, el proyecto no se cargaba más allá de la primera página de «inicialización». A pesar de no haber tenido ningún problema con las iteraciones anteriores, se necesitaron 11 (sí, de verdad) reconstrucciones completas adicionales para descubrir qué estaba pasando.

La recreación del proyecto con Gemini y ChatGPT funcionó a la perfección. Todas las funciones, básicas y avanzadas, funcionaron como deberían, incluida la carga de archivos, el resaltado de pruebas, la conversión de texto a voz y los efectos visuales y de audio cuando las palabras desencadenantes se pronunciaban en voz alta. Volviendo a los modelos, vi muy poca diferencia en función o rendimiento al darle el mismo mensaje a cada uno de los chatbots.

Inconsistencias de los chatbots

Adquirir el archivo para probar siempre fue fácil con Claude. No solo ofrecía una vista previa del proyecto, por lo que nunca necesitabas descargar el archivo HTML, sino que, si querías (lo que hacía a menudo para probar), estaba disponible para descargarlo directamente. Esta opción solo se ofrecía a veces con ChatGPT, mientras que en otras ocasiones solo podía copiar el HTML y guardarlo por mi cuenta.

A pesar de tener la menor cantidad de errores y escrúpulos generales con Géminis, siempre requirió que tomaras el camino largo y lo hicieras de esta manera. Aparte de eso, el hecho de que ChatGPT sólo a veces me ofreciera permitirme descargar el archivo directamente como HTML era peculiar y un poco frustrante.

El ganador: Depende

Definir un ganador para este tipo de prueba es complicado, ya que todos los chatbots tienen ventajas y desventajas. En cierto sentido, todos ganan. Cada uno pudo crear una versión funcional del proyecto en algún momento, pero a menudo requirió esfuerzos repetidos.

Al final, el ganador es el usuario. Esto demuestra que, independientemente del modelo que se utilice, un conjunto sólido de instrucciones puede llevarlo lejos. No pude distinguir diferencias en rendimiento o función entre la aplicación creada por Gemini 3 Pro y las versiones gratuitas de ChatGPT o Claude.

En realidad, esto va directamente en contra de lo que encontré al tener una conversación similar con los modelos Gemini pro y free. Si bien ese fue otro día, otro proyecto y otro modelo, demuestra que un mensaje sólido puede llevarte increíblemente lejos en el mundo de la codificación por vibración.


We use cookies in order to give you the best possible experience on our website. By continuing to use this site, you agree to our use of cookies.
Accept