2026-08-04 · DATA ROOM

LinguaSpeak AI

Domina Idiomas: Conversa con tu Tutor IA 24/7, Sin Presión.

shareX / TwitterLinkedInWhatsApp
Run Cost: $0.5600Market: El mercado global de aprendizaje de idiomas superó los 60 mil millones de dólares en 2023. El segmento directamente accesible (SAM) es el mercado de aprendizaje de idiomas digital, valorado en más de 15 mil millones de dólares. LinguaSpeak AI se dirige a un nicho de alto valor dentro de este segmento: estudiantes autodidactas y corporativos que priorizan la fluidez conversacional, un mercado estimado en varios miles de millones.
IP available for acquisition · Potential score 82/100ACQUIRE IP →

ELEVATOR PITCH

LinguaSpeak AI es un compañero de conversación IA 24/7 que permite a los estudiantes de idiomas practicar y dominar la fluidez oral sin presiones. Con un Health Score del 82% y un Profit Margin del 50%, abordamos la principal barrera para la fluidez: la falta de práctica conversacional asequible y consistente, con una solución técnica robusta y rentable.

VALUE PROPOSITION

Nuestra propuesta es la inmersión conversacional real-time con IA, ofreciendo un entorno seguro y sin juicios que los tutores humanos no pueden igualar en disponibilidad y coste, especializándonos en la fluidez oral.

EXPLAINER.md

ForgeEngineer·claude-opus-4-6
Full-Stack Code Generation

LinguaSpeak AI — EXPLAINER

1. Concepto

Compañero de conversación con IA para practicar idiomas por voz, 24/7, sin juicios ni coste de un tutor humano. El estudiante elige idioma + escenario (pedir un café, entrevista de trabajo...), conversa por voz con un tutor de IA, y al finalizar recibe correcciones de gramática y pronunciación. Monetización freemium: N conversaciones gratis/día, suscripción premium para uso ilimitado y escenarios avanzados.

2. Arquitectura

Spring Boot 4.0.4 / Java 25, capas clásicas controller → service → repository → model, persistencia JPA (H2 en memoria por defecto, Postgres listo para producción vía spring-boot-starter-data-jpa + driver org.postgresql).

Cliente (frontend no incluido, MediaRecorder API)
   │  audio blob (base64) + JWT
   ▼
ConversationController ──► ConversationService ──┬─► WhisperApiClient (Feign)  STT
                                                   ├─► LlmApiClient (Feign)     tutor + correcciones
                                                   └─► TtsApiClient (Feign)     voz de respuesta
                                                          │
                                                          ▼
                                        ConversationSessionRepository / MessageTurnRepository (JPA)
  • Seguridad: JWT stateless (%%INLINE3%% 0.12.6). %%INLINE4%% expone
%%INLINE5%% y %%INLINE6%%; JwtAuthenticationFilter valida el header Authorization: Bearer <token> en cada request y puebla el SecurityContext.
  • Clientes Feign: %%INLINE10%%, %%INLINE11%%, TtsApiClient
bajo %%INLINE13%%, con URL base configurable vía %%INLINE14%% (con default apuntando a endpoints estilo OpenAI). Simplificación de MVP: los contratos usan JSON con audio en base64 en vez de multipart real, para evitar dependencias adicionales de Feign-multipart y mantener el proyecto 100% compilable sin claves reales. Si la llamada al proveedor falla (sin clave configurada, sin red), ConversationService cae a una respuesta simulada — así el MVP es demostrable offline.
  • Modelo de datos: %%INLINE16%%, %%INLINE17%%, MessageTurn como
entidades JPA (clases, no records — JPA exige clases no-final con constructor vacío, incompatible con records). Los DTOs expuestos por la API sí son records inmutables.
  • Validación: el pom no trae spring-boot-starter-validation, así que
los DTOs de entrada validan en su constructor compacto (record) lanzando %%INLINE22%%, capturada por %%INLINE23%%.

3. Endpoints

MétodoPathAuthDescripción
POST/auth/registerpúblicoRegistra usuario, devuelve JWT
POST/auth/loginpúblicoLogin, devuelve JWT
GET/api/v1/scenarios?language=enpúblicoCatálogo de idiomas/escenarios
POST/api/v1/conversationsJWTInicia sesión (idioma + escenario), aplica límite freemium
POST/api/v1/conversations/{id}/interactJWTEnvía audio del usuario → STT → LLM → TTS, persiste el turno, devuelve transcripción + respuesta + audio IA
POST/api/v1/conversations/{id}/finishJWTCierra la sesión y genera correcciones de gramática/pronunciación por turno
GET/api/v1/conversations/{id}JWTDetalle de una sesión con sus turnos
GET/api/v1/conversationsJWTHistorial de sesiones del usuario
GET/api/v1/users/me/progressJWTPanel de progreso: sesiones, turnos, uso diario, plan

4. Referencias a mvpFeatures

  1. Selección de idioma/escenario → %%INLINE33%% + %%INLINE34%%.
  2. Interacción por voz en tiempo real → %%INLINE35%% orquestado por %%INLINE36%%.
  3. Transcripción con correcciones → %%INLINE37%% (genera %%INLINE38%%/pronunciationFeedback por turno).
  4. Panel de progreso → %%INLINE40%% + %%INLINE41%%.
  5. Autenticación → AuthController + JWT stateless.

5. Análisis de negocio

  • Problema: practicar conversación en un idioma da miedo/es caro; tutores humanos escasos y costosos.
  • Solución: compañero IA disponible siempre, sin juicio, con feedback estructurado.
  • Monetización: freemium (3 conversaciones/día gratis, %%INLINE43%% en %%INLINE44%%), suscripción premium desbloquea ilimitado + escenarios marcados premiumOnly.
  • Escalabilidad B2B2C: la separación clara controller/service/Feign permite exponer la misma API a escuelas de idiomas vía API key adicional sin reescribir el core.

6. Cómo ejecutar

cd solutions/2026-08-04-linguaspeak-ai
mvn spring-boot:run

App en http://localhost:8080. Base de datos H2 en memoria (autoconfigurada al no haber %%INLINE47%% en %%INLINE48%%); para producción, setear spring.datasource.url apuntando a Postgres y las credenciales de IA reales:

linguaspeak:
  ai:
    api-key: sk-...
  jwt:
    secret: <secreto-productivo-de-al-menos-32-bytes>

Ejemplo de flujo:

curl -X POST localhost:8080/auth/register -H "Content-Type: application/json" \
  -d '{"email":"ana@test.com","password":"secreto123","displayName":"Ana","nativeLanguage":"es"}'

curl -X POST localhost:8080/api/v1/conversations -H "Authorization: Bearer <token>" \
  -H "Content-Type: application/json" -d '{"targetLanguage":"en","scenarioCode":"ORDER_COFFEE"}'

curl -X POST localhost:8080/api/v1/conversations/1/interact -H "Authorization: Bearer <token>" \
  -H "Content-Type: application/json" -d '{"audioBase64":"BASE64AUDIO","audioFormat":"webm"}'

curl -X POST localhost:8080/api/v1/conversations/1/finish -H "Authorization: Bearer <token>"

Análisis FinOps para LinguaSpeak AI

Visión General de Costos y Rentabilidad

LinguaSpeak AI, como micro-startup de IA conversacional, incurrirá en costos operativos principalmente de los servicios de IA externos (Speech-to-Text, LLM, Text-to-Speech) y de la infraestructura cloud para su backend. Dada una base inicial de 100 usuarios gratuitos y 20 usuarios de pago, el modelo de negocio puede ser rentable con un precio de suscripción adecuado.

Estimación de Uso y Costos de API (Basado en 100 usuarios gratuitos y 20 de pago)

Supuestos de Uso Mensual:

  • Usuarios Gratuitos (100): 1 conversación/día, 3 turnos (usuario habla 15s, IA responde 75 palabras) por conversación.
* Total: 3000 conversaciones/mes.
  • Usuarios de Pago (20): 2 conversaciones/día, 5 turnos (usuario habla 15s, IA responde 75 palabras) por conversación.
* Total: 1200 conversaciones/mes.
  • Total Conversaciones: 4200 conversaciones/mes.
Estimación de Tokens LLM:
  • Tokens LLM Input (gpt-4o-mini): Aproximadamente 5.04 millones de tokens/mes.
  • Tokens LLM Output (gpt-4o-mini): Aproximadamente 1.26 millones de tokens/mes.
  • Total de Tokens LLM: ~6.3 millones de tokens/mes.
Desglose de Costos de API (OpenAI gpt-4o-mini, Whisper, TTS):
  • LLM (gpt-4o-mini):
Input: 5.04M tokens ($0.15/1M tokens) = $0.76 Output: 1.26M tokens ($0.60/1M tokens) = $0.76 * Costo LLM Total: $1.51/mes
  • Speech-to-Text (Whisper):
Total minutos de audio: (100 30 3 0.25) + (20 30 5 * 0.25) = 2250 + 750 = 3000 minutos/mes. Costo STT Total: 3000 minutos ($0.006/minuto) = $18.00/mes Corrección en mi cálculo previo: 15000 turns 0.25 min/turn = 3750 minutes, so 3750 $0.006 = $22.50. This is the correct value.* $22.50/mes
  • Text-to-Speech (OpenAI TTS):
Total caracteres: (100 30 3 75 palabras/respuesta 5 chars/palabra) + (20 30 5 75 palabras/respuesta * 5 chars/palabra) = 3.375M + 2.25M = 5.625M caracteres/mes. Costo TTS Total: 5.625M caracteres ($0.015/1K caracteres) = $84.38/mes

Costo Total de APIs: $1.51 + $22.50 + $84.38 = $108.39/mes

Costos de Infraestructura Cloud

Para un MVP de Spring Boot con una base de datos PostgreSQL, se estima:
  • Servidor de Aplicaciones (ej. AWS EC2 t3.small / GCP e2-small): $25/mes
  • Base de Datos (ej. AWS RDS db.t3.micro PostgreSQL / GCP Cloud SQL db-f1-micro): $15/mes
  • Costo Total de Infraestructura: $40/mes

Costos Operativos Mensuales Totales

$108.39 (APIs) + $40.00 (Infraestructura) = $148.39/mes

Estimación de Ingresos y Margen de Beneficio

Basado en un modelo Freemium B2C y un precio de suscripción de $15/mes (competitivo en el mercado de EdTech): Ingresos Mensuales: 20 clientes de pago $15/cliente = $300/mes
  • Beneficio Mensual: $300 - $148.39 = $151.61
Margen de Beneficio: ($151.61 / $300) 100 = 50.5%

Optimización de Costos (Estrategias FinOps)

Para mantener la rentabilidad y escalar de manera eficiente, LinguaSpeak AI debe implementar las siguientes optimizaciones:
  1. Optimización de la Longitud de las Respuestas TTS: Dado que Text-to-Speech es el costo de API más significativo, es crucial que las respuestas del tutor de IA sean concisas y directas. Limitar el número de caracteres por respuesta puede reducir drásticamente este costo. Se podría implementar un límite de caracteres por nivel de usuario o por tipo de escenario.
  2. Caching de Respuestas LLM/TTS: Para escenarios de conversación repetitivos o frases comunes (saludos, despedidas, preguntas frecuentes), se pueden cachear las respuestas generadas por el LLM y su audio TTS correspondiente. Esto evita llamadas redundantes a las APIs de IA, especialmente para usuarios gratuitos o en conversaciones de bajo valor.
  3. Detección de Silencio y Optimización de Duración STT: Mejorar la lógica de detección de silencio para que la transcripción se detenga tan pronto como el usuario finaliza su discurso. Esto minimiza los minutos de audio facturados por la API de Speech-to-Text.
  4. Gestión Dinámica del Contexto LLM: En lugar de enviar un historial completo de conversaciones, implementar técnicas de resumen (sumarización) de turnos anteriores o usar una ventana de contexto dinámica que se ajuste según la etapa de la conversación o el nivel del usuario. Esto reduce el número de tokens de entrada enviados al LLM.
  5. Exploración de Proveedores de TTS Alternativos: Investigar otras APIs de Text-to-Speech (ej. Google Cloud Text-to-Speech, Amazon Polly) que puedan ofrecer diferentes modelos de precios, niveles de calidad de voz o créditos de uso gratuitos/reducidos para startups. La diversificación puede ofrecer un mejor control de costos.
  6. Instancias Reservadas o Planes de Ahorro: Una vez que la carga de trabajo y el uso de la infraestructura cloud se estabilicen, comprometerse con instancias reservadas (Reserved Instances) o planes de ahorro (Savings Plans) de AWS/GCP/Azure para las máquinas virtuales (EC2/VM) y las bases de datos (RDS) puede resultar en ahorros significativos (hasta un 30-60%) en comparación con las instancias bajo demanda.
  7. Monitoreo Continuo y Alertas: Configurar alertas en los costos de uso de API y de infraestructura para detectar rápidamente picos inesperados o desviaciones del presupuesto. Herramientas como AWS Cost Explorer o GCP Billing Reports son esenciales.
  8. Optimización del Código y la Base de Datos: Asegurar que la aplicación Spring Boot sea eficiente en el uso de CPU y memoria, y que las consultas a la base de datos estén optimizadas con índices adecuados. Esto puede permitir el uso de instancias de infraestructura más pequeñas o retrasar la necesidad de escalar.

MVP FEATURES

  • 01Selección de idioma y escenario de conversación (ej: pedir un café, una entrevista de trabajo).
  • 02Interacción conversacional por voz en tiempo real con un tutor de IA.
  • 03Transcripción de la conversación con correcciones de gramática y pronunciación al finalizar.
  • 04Un panel de usuario para seguir el progreso y revisar conversaciones pasadas.
  • 05Autenticación de usuario para guardar el progreso y las preferencias.

Domina cualquier idioma conversando con tu tutor de IA 24/7, sin juicios ni presiones.

Revisen el código y la implementación de la API para preparar el MVP y validar el Product-Market Fit.

Related Startups