2026-08-04 · DATA ROOM
LinguaSpeak AI
Domina Idiomas: Conversa con tu Tutor IA 24/7, Sin Presión.
ELEVATOR PITCH
LinguaSpeak AI es un compañero de conversación IA 24/7 que permite a los estudiantes de idiomas practicar y dominar la fluidez oral sin presiones. Con un Health Score del 82% y un Profit Margin del 50%, abordamos la principal barrera para la fluidez: la falta de práctica conversacional asequible y consistente, con una solución técnica robusta y rentable.
VALUE PROPOSITION
Nuestra propuesta es la inmersión conversacional real-time con IA, ofreciendo un entorno seguro y sin juicios que los tutores humanos no pueden igualar en disponibilidad y coste, especializándonos en la fluidez oral.
EXPLAINER.md
LinguaSpeak AI — EXPLAINER
1. Concepto
Compañero de conversación con IA para practicar idiomas por voz, 24/7, sin juicios ni coste de un tutor humano. El estudiante elige idioma + escenario (pedir un café, entrevista de trabajo...), conversa por voz con un tutor de IA, y al finalizar recibe correcciones de gramática y pronunciación. Monetización freemium: N conversaciones gratis/día, suscripción premium para uso ilimitado y escenarios avanzados.
2. Arquitectura
Spring Boot 4.0.4 / Java 25, capas clásicas controller → service →
repository → model, persistencia JPA (H2 en memoria por defecto, Postgres listo para producción vía spring-boot-starter-data-jpa + driver org.postgresql).
Cliente (frontend no incluido, MediaRecorder API)
│ audio blob (base64) + JWT
▼
ConversationController ──► ConversationService ──┬─► WhisperApiClient (Feign) STT
├─► LlmApiClient (Feign) tutor + correcciones
└─► TtsApiClient (Feign) voz de respuesta
│
▼
ConversationSessionRepository / MessageTurnRepository (JPA)
- Seguridad: JWT stateless (%%INLINE3%% 0.12.6). %%INLINE4%% expone
JwtAuthenticationFilter valida el
header Authorization: Bearer <token> en cada request y puebla el
SecurityContext.
- Clientes Feign: %%INLINE10%%, %%INLINE11%%,
TtsApiClient
ConversationService cae a una respuesta
simulada — así el MVP es demostrable offline.
- Modelo de datos: %%INLINE16%%, %%INLINE17%%,
MessageTurncomo
final con
constructor vacío, incompatible con records). Los DTOs expuestos por la
API sí son records inmutables.
- Validación: el pom no trae
spring-boot-starter-validation, así que
3. Endpoints
| Método | Path | Auth | Descripción |
|---|---|---|---|
| POST | /auth/register | público | Registra usuario, devuelve JWT |
| POST | /auth/login | público | Login, devuelve JWT |
| GET | /api/v1/scenarios?language=en | público | Catálogo de idiomas/escenarios |
| POST | /api/v1/conversations | JWT | Inicia sesión (idioma + escenario), aplica límite freemium |
| POST | /api/v1/conversations/{id}/interact | JWT | Envía audio del usuario → STT → LLM → TTS, persiste el turno, devuelve transcripción + respuesta + audio IA |
| POST | /api/v1/conversations/{id}/finish | JWT | Cierra la sesión y genera correcciones de gramática/pronunciación por turno |
| GET | /api/v1/conversations/{id} | JWT | Detalle de una sesión con sus turnos |
| GET | /api/v1/conversations | JWT | Historial de sesiones del usuario |
| GET | /api/v1/users/me/progress | JWT | Panel de progreso: sesiones, turnos, uso diario, plan |
4. Referencias a mvpFeatures
- Selección de idioma/escenario → %%INLINE33%% + %%INLINE34%%.
- Interacción por voz en tiempo real → %%INLINE35%% orquestado por %%INLINE36%%.
- Transcripción con correcciones → %%INLINE37%% (genera %%INLINE38%%/
pronunciationFeedbackpor turno). - Panel de progreso → %%INLINE40%% + %%INLINE41%%.
- Autenticación →
AuthController+ JWT stateless.
5. Análisis de negocio
- Problema: practicar conversación en un idioma da miedo/es caro; tutores humanos escasos y costosos.
- Solución: compañero IA disponible siempre, sin juicio, con feedback estructurado.
- Monetización: freemium (3 conversaciones/día gratis, %%INLINE43%% en %%INLINE44%%), suscripción premium desbloquea ilimitado + escenarios marcados
premiumOnly. - Escalabilidad B2B2C: la separación clara controller/service/Feign permite exponer la misma API a escuelas de idiomas vía API key adicional sin reescribir el core.
6. Cómo ejecutar
cd solutions/2026-08-04-linguaspeak-ai
mvn spring-boot:run
App en http://localhost:8080. Base de datos H2 en memoria (autoconfigurada al no haber %%INLINE47%% en %%INLINE48%%); para producción, setear spring.datasource.url apuntando a Postgres y las credenciales de IA reales:
linguaspeak:
ai:
api-key: sk-...
jwt:
secret: <secreto-productivo-de-al-menos-32-bytes>
Ejemplo de flujo:
curl -X POST localhost:8080/auth/register -H "Content-Type: application/json" \
-d '{"email":"ana@test.com","password":"secreto123","displayName":"Ana","nativeLanguage":"es"}'
curl -X POST localhost:8080/api/v1/conversations -H "Authorization: Bearer <token>" \
-H "Content-Type: application/json" -d '{"targetLanguage":"en","scenarioCode":"ORDER_COFFEE"}'
curl -X POST localhost:8080/api/v1/conversations/1/interact -H "Authorization: Bearer <token>" \
-H "Content-Type: application/json" -d '{"audioBase64":"BASE64AUDIO","audioFormat":"webm"}'
curl -X POST localhost:8080/api/v1/conversations/1/finish -H "Authorization: Bearer <token>"
Análisis FinOps para LinguaSpeak AI
Visión General de Costos y Rentabilidad
LinguaSpeak AI, como micro-startup de IA conversacional, incurrirá en costos operativos principalmente de los servicios de IA externos (Speech-to-Text, LLM, Text-to-Speech) y de la infraestructura cloud para su backend. Dada una base inicial de 100 usuarios gratuitos y 20 usuarios de pago, el modelo de negocio puede ser rentable con un precio de suscripción adecuado.Estimación de Uso y Costos de API (Basado en 100 usuarios gratuitos y 20 de pago)
Supuestos de Uso Mensual:
- Usuarios Gratuitos (100): 1 conversación/día, 3 turnos (usuario habla 15s, IA responde 75 palabras) por conversación.
- Usuarios de Pago (20): 2 conversaciones/día, 5 turnos (usuario habla 15s, IA responde 75 palabras) por conversación.
- Total Conversaciones: 4200 conversaciones/mes.
- Tokens LLM Input (gpt-4o-mini): Aproximadamente 5.04 millones de tokens/mes.
- Tokens LLM Output (gpt-4o-mini): Aproximadamente 1.26 millones de tokens/mes.
- Total de Tokens LLM: ~6.3 millones de tokens/mes.
- LLM (gpt-4o-mini):
- Speech-to-Text (Whisper):
- Text-to-Speech (OpenAI TTS):
Costo Total de APIs: $1.51 + $22.50 + $84.38 = $108.39/mes
Costos de Infraestructura Cloud
Para un MVP de Spring Boot con una base de datos PostgreSQL, se estima:- Servidor de Aplicaciones (ej. AWS EC2 t3.small / GCP e2-small): $25/mes
- Base de Datos (ej. AWS RDS db.t3.micro PostgreSQL / GCP Cloud SQL db-f1-micro): $15/mes
- Costo Total de Infraestructura: $40/mes
Costos Operativos Mensuales Totales
$108.39 (APIs) + $40.00 (Infraestructura) = $148.39/mesEstimación de Ingresos y Margen de Beneficio
Basado en un modelo Freemium B2C y un precio de suscripción de $15/mes (competitivo en el mercado de EdTech): Ingresos Mensuales: 20 clientes de pago $15/cliente = $300/mes- Beneficio Mensual: $300 - $148.39 = $151.61
Optimización de Costos (Estrategias FinOps)
Para mantener la rentabilidad y escalar de manera eficiente, LinguaSpeak AI debe implementar las siguientes optimizaciones:- Optimización de la Longitud de las Respuestas TTS: Dado que Text-to-Speech es el costo de API más significativo, es crucial que las respuestas del tutor de IA sean concisas y directas. Limitar el número de caracteres por respuesta puede reducir drásticamente este costo. Se podría implementar un límite de caracteres por nivel de usuario o por tipo de escenario.
- Caching de Respuestas LLM/TTS: Para escenarios de conversación repetitivos o frases comunes (saludos, despedidas, preguntas frecuentes), se pueden cachear las respuestas generadas por el LLM y su audio TTS correspondiente. Esto evita llamadas redundantes a las APIs de IA, especialmente para usuarios gratuitos o en conversaciones de bajo valor.
- Detección de Silencio y Optimización de Duración STT: Mejorar la lógica de detección de silencio para que la transcripción se detenga tan pronto como el usuario finaliza su discurso. Esto minimiza los minutos de audio facturados por la API de Speech-to-Text.
- Gestión Dinámica del Contexto LLM: En lugar de enviar un historial completo de conversaciones, implementar técnicas de resumen (sumarización) de turnos anteriores o usar una ventana de contexto dinámica que se ajuste según la etapa de la conversación o el nivel del usuario. Esto reduce el número de tokens de entrada enviados al LLM.
- Exploración de Proveedores de TTS Alternativos: Investigar otras APIs de Text-to-Speech (ej. Google Cloud Text-to-Speech, Amazon Polly) que puedan ofrecer diferentes modelos de precios, niveles de calidad de voz o créditos de uso gratuitos/reducidos para startups. La diversificación puede ofrecer un mejor control de costos.
- Instancias Reservadas o Planes de Ahorro: Una vez que la carga de trabajo y el uso de la infraestructura cloud se estabilicen, comprometerse con instancias reservadas (Reserved Instances) o planes de ahorro (Savings Plans) de AWS/GCP/Azure para las máquinas virtuales (EC2/VM) y las bases de datos (RDS) puede resultar en ahorros significativos (hasta un 30-60%) en comparación con las instancias bajo demanda.
- Monitoreo Continuo y Alertas: Configurar alertas en los costos de uso de API y de infraestructura para detectar rápidamente picos inesperados o desviaciones del presupuesto. Herramientas como AWS Cost Explorer o GCP Billing Reports son esenciales.
- Optimización del Código y la Base de Datos: Asegurar que la aplicación Spring Boot sea eficiente en el uso de CPU y memoria, y que las consultas a la base de datos estén optimizadas con índices adecuados. Esto puede permitir el uso de instancias de infraestructura más pequeñas o retrasar la necesidad de escalar.
MVP FEATURES
- 01Selección de idioma y escenario de conversación (ej: pedir un café, una entrevista de trabajo).
- 02Interacción conversacional por voz en tiempo real con un tutor de IA.
- 03Transcripción de la conversación con correcciones de gramática y pronunciación al finalizar.
- 04Un panel de usuario para seguir el progreso y revisar conversaciones pasadas.
- 05Autenticación de usuario para guardar el progreso y las preferencias.
“Domina cualquier idioma conversando con tu tutor de IA 24/7, sin juicios ni presiones.”
Revisen el código y la implementación de la API para preparar el MVP y validar el Product-Market Fit.
GeoRank AI
87GeoRank AI es un Micro-SaaS que transforma el Google Business Profile de PyMEs locales, como restaurantes y tiendas, en un imán de clientes. Nuestro agente de IA automatiza la generación de contenido hiperlocal y respuestas a reseñas, con un Health Score robusto del 87% y un margen de beneficio del 91%, liberando tiempo a los dueños y atrayendo más tráfico.
LexiGuard AI
87LexiGuard AI revoluciona la creación de contenido para industrias reguladas, permitiendo a equipos de marketing y cumplimiento generar textos conformes al instante y con riesgo cero. Con un sólido Health Score del 87% y una UX del 91%, nuestra solución elimina errores costosos, acelera la agilidad del negocio y asegura auditorías impecables.
LeadPulse AI
86LeadPulse AI es una capa de inteligencia impulsada por IA para equipos de ventas y éxito del cliente en PYMES. Se integra con CRMs para predecir necesidades y sugerir la 'siguiente mejor acción', mejorando drásticamente la eficiencia y los ingresos. Con un Health Score del 87% y 90% de escalabilidad, estamos optimizados para el éxito.