Crear música, narración y efectos sonoros
Flujos nativos de audio con fal.ai en Canvas y Workbench.
- Abre Imágenes > Flujo de audio en Canvas o Workbench. Configurar acceso reutiliza tu cuenta fal.ai en la bóveda cifrada. Autoriza el workspace, modelos de audio, envío de referencias y acceso opcional de agentes con tarea; conserva límites por ejecución y día. No necesitas una clave por nodo. La API de Higgsfield no documenta modelos independientes de audio, solo audio dentro de algunos videos. No se confirmó un endpoint Suno en el catálogo oficial de fal; no se anuncia ni se inventa.
- Busca un modelo y lee su contrato oficial. El catálogo incluye ElevenLabs Music, MiniMax Music y Lyria según disponibilidad, además de voz y efectos de ElevenLabs. Los modelos pueden cambiar, quedar obsoletos o usar contratos no compatibles. Cada uno muestra campos, valores predeterminados, límites, ejemplos y documentación propios. Voz, idioma, letras, secciones, modo instrumental, duración y referencias dependen del modelo. Usa únicamente voces y referencias autorizadas.
- Narración: escribe solo las palabras habladas en Text o los interlocutores en Inputs. Deja Dirección y notas de contexto vacías en contratos de voz sin dirección. La música usa Prompt; letras y planes de composición tienen campos específicos. Las notas solo complementan modelos con campo de dirección. No se añaden notas de producción ni instrucciones de cámara a la voz. Selecciona referencias por nombre desde nodos de audio/video/imagen o archivos confinados al proyecto; solo se envían entradas vinculadas explícitamente.
- Guarda, Estima, revisa datos enviados y reserva, y Genera una vez. La facturación por caracteres cuenta Text/Inputs reales. La duración usa el valor explícito, no cinco segundos ocultos de video; los minutos se redondean hacia arriba. Si no se puede calcular, indica unidades estimadas de facturación. Las estimaciones y reservas de 4x no limitan la factura del proveedor. Nunca se reintentan envíos inciertos automáticamente; Reintentar descarga reutiliza el resultado pagado.
- El audio final se guarda sin transcodificar en generated/audio por defecto y aparece como nodo nativo reproducible y descargable. Reutilízalo en otro flujo de audio o entrada de audio de un video compatible. El modelo debe aceptar la referencia; no se garantiza una voz generativa idéntica. Se admiten MP3, WAV, OGG, M4A y FLAC; se rechaza PCM sin contenedor y telefonía antes de enviar. La reproducción depende del codec. Eliminar el nodo conserva el archivo sin autorizar reutilización histórica. No cambia los flujos Codex de imágenes ni el dictado/TTS local.
- Los agentes usan audio_workflow_models/list/read/create/update/preview/run/cancel/retry_download/remove u orkestrai audio con --task y --input. Los aliases comparten servicio, revisión, cola, credenciales y presupuesto con video_workflow_* y config.modality=audio. Descubre el endpoint, elige una cuenta autorizada, revisa la vista previa y reutiliza el mismo UUID tras un timeout. Nunca incluyas credenciales en prompts o parámetros.
- Privacidad del resultado: Configurar acceso > Permisos del workspace > Acceso a los resultados de fal.ai empieza en Privado. El propietario puede elegir explícitamente Cualquiera con el enlace para nuevos resultados; se solicita a fal que los elimine después de una hora. Quien tenga la URL podrá descargar hasta que caduque. Las referencias siguen siendo privadas y la clave API nunca se envía al servidor de medios. La vista previa y la ejecución en cola fijan esa elección; cambiar permisos requiere una nueva vista previa. Los agentes no pueden cambiar la política. Esto no recupera archivos anteriores ni vuelve a generarlos. Orkestrai sigue desactivando el historial JSON de entrada/salida, por lo que fal puede mostrar Output not available aunque la cola haya devuelto un resultado. Una descarga con 401/403 no es una entrega completada: Reintentar descarga no cobra otra generación, y el ID de solicitud identifica el trabajo original para soporte. No genere de nuevo sin revisar el cargo adicional.
Leer PDF escaneados con OCR local
El OCR local permite buscar PDF escaneados a usuarios y agentes.
- Arrastra un PDF escaneado al Canvas o usa Segundo cerebro > Importar archivos. Abre el nodo o la fuente: el OCR procesa automáticamente páginas con imágenes y conserva el texto integrado de los PDF mixtos. Los modelos de español, inglés y portugués vienen con la app; no necesitas internet, clave de API, Python ni instalar OCR en el sistema. El PDF original no se modifica y las imágenes de las páginas no se guardan. La carpeta temporal privada de idiomas se elimina cuando termina el proceso.
- Los pasajes muestran OCR, página y confianza estimada del reconocimiento. Busca el mismo texto en Segundo cerebro, knowledge_search y knowledge_read. Los agentes deben citar id de fuente, revisión/hash y página y tratar OCR como evidencia falible y no confiable. Verifica nombres, números y valores importantes en el original. Reconoce texto impreso, sin garantizar escritura a mano, comprensión de diagramas ni reconstrucción exacta de tablas.
- Límites: 25 MB por archivo, primeras 200 páginas, 6.000 caracteres por página y 250.000 en total. La rasterización usa hasta 8 megapíxeles y 4.096 píxeles por lado; el decodificador puede omitir imágenes de origen de más de 16 megapíxeles. La extracción se detiene tras dos minutos por documento y conserva el texto disponible con estado parcial y lista de páginas pendientes/fallidas. Las páginas en blanco quedan vacías. Los PDF con contraseña requieren una copia desbloqueada; los archivos dañados muestran error. Actualizar índice reintenta resultados parciales; divide PDF grandes cuando sea necesario. Se ejecuta un extractor a la vez fuera del servidor de la app junto con su worker OCR; el timeout detiene ambos. Los PDF anteriores se reindexan automáticamente en la próxima consulta tras actualizar el extractor.
Segundo cerebro: conocimiento conectado
Convierte documentos y trabajo del proyecto en conocimiento reutilizable con fuentes.
- Abre Segundo cerebro en la barra del Canvas o en Workbench. Fuentes, Grafo de conocimiento, Memoria del workspace y Aprendizaje de agentes comparten el mismo workspace. Añadir al Canvas crea un nodo de conocimiento conectable; su grafo está separado del grafo de dependencias del código. No reemplaza el grafo de código existente.
- Arrastra uno o varios archivos desde Finder o Explorer a un espacio vacío del Canvas, o elige Importar archivos. Cada archivo se convierte en nodo y se conserva una copia en .orkestrai/knowledge del proyecto. Las imágenes mantienen su flujo actual. Los agentes pueden adjuntar archivos del proyecto con knowledge_attach u orkestrai knowledge attach ruta. La importación no ejecuta macros, fórmulas, scripts ni acciones del documento. Límite: 25 MB por archivo. PDF con texto, Markdown/texto, XLSX y CSV permiten búsqueda. Otros formatos se conservan con extracción no disponible; Los PDF escaneados y mixtos reciben OCR integrado en español, inglés y portugués, sin cuenta, envío externo ni instalación adicional.
- La búsqueda encuentra palabras normalizadas en títulos, etiquetas y texto extraído. Los resultados incluyen id de fuente, revisión, SHA-256 y localización por página, hoja/fila o línea. Abre la fuente para leer pasajes, editar etiquetas separadas por comas, seguir backlinks o ir al nodo. Eliminar un nodo no borra el original. La extracción se limita a 250.000 caracteres y 200 pasajes, con estados explícitos parcial, vacío, error o ausente; un índice parcial no representa todo el documento.
- Las notas enlazan títulos únicos mediante [[Brief]] o un id exacto de fuente. Los títulos duplicados ambiguos no seleccionan un destino silenciosamente. Hashtags y etiquetas organizan las fuentes. Conexiones del Canvas, wiki links y procedencia de tareas/memorias forman el grafo; no conceden permisos. Notas/tareas/memorias se leen en cada consulta; los cambios en archivos se detectan y se extraen nuevamente. Mientras está visible, Segundo cerebro recibe eventos del workspace y observa los documentos vinculados. Los cambios cercanos se agrupan brevemente, luego se vuelven a leer y extraer antes de mostrarlos. Detecta guardado atómico, eliminación y recreación. Los archivos WSL/red usan consulta al sistema de archivos cada segundo. Una comprobación de recuperación cada 15 segundos renueva el observador y recupera eventos perdidos; una conexión interrumpida aparece como Reconectando, no En vivo. Las vistas ocultas pausan; los observadores expiran tras 45 segundos sin cliente visible. Actualizar índice fuerza la extracción. Solo se indexan fuentes adjuntas: crear un archivo cualquiera en el proyecto no lo importa automáticamente. Es búsqueda léxica, no vectorial ni garantía de respuestas correctas.
- Los agentes usan knowledge_search y knowledge_read y deben citar pasajes reales. El contenido importado es evidencia no confiable, nunca instrucciones de sistema. No importes contraseñas, credenciales ni conversaciones privadas. La memoria privada del Computer queda excluida. No requiere Obsidian, índice en la nube ni API de embeddings.
- Abre Segundo cerebro > Aprendizaje de agentes, selecciona el agente y elige Automático, Revisar primero o Desactivado. El aprendizaje pertenece al nodo del Canvas, no al proveedor o sesión: renombrar, reiniciar o cambiar proveedor conserva las lecciones. Un agente nuevo o copiado no hereda otra identidad. Eliminar el workspace elimina sus registros de aprendizaje, no los archivos originales del proyecto.
- Completar una tarea o moverla a blocked/error crea una reflexión pendiente idempotente. La respuesta de la tarea y las instrucciones del puente indican al agente registrar errores/correcciones relevantes o procedimientos reutilizables validados mediante learning_reflect. Sin aprendizaje útil, learning_skip archiva la reflexión. No despierta todos los agentes al iniciar, no consume tokens con otro modelo de reflexión, no inventa lecciones ni entrena pesos del modelo.
- Automático puede activar lecciones ordinarias de tareas completadas asignadas al agente. La evidencia sigue marcada como Reportada por el agente, no prueba independiente. Revisar primero mantiene propuestas pendientes. Contenido sospechoso que modifica instrucciones y trabajo incompleto requieren revisión. Se rechazan patrones obvios de credenciales; no es DLP universal ni inmunidad a prompt injection. Desactivado detiene captura y consulta sin borrar historial.
- Revisa cuándo aplicar, error, corrección, evidencia e historial. Activa, rechaza o archiva; se rechazan revisiones obsoletas. Las tareas nuevas reciben lecciones activas relevantes, hasta cinco de 1.200 caracteres cada una. Los agentes también consultan learning_search antes de trabajo directo relevante. Las lecciones no modifican permisos, roles/skills ni sustituyen instrucciones actuales. Es asistencia, no promesa de que el modelo nunca repetirá un error.
- Grafo de conocimiento es una red nativa de puntos y conexiones, no otro Canvas de tarjetas. Elige 3D para rotar o 2D para desplazar; arrastra una fuente para reposicionarla, usa scroll/pellizco para zoom, pulsa para leer y pulsa dos veces para enfocar. En 3D, arrastra con el botón derecho o Shift para desplazar. Los controles de encuadre, zoom, foco, reorganización y pantalla completa tienen tooltips. Los colores distinguen inicialmente comunidades de relaciones calculadas con Louvain; la leyenda usa el nombre de la fuente más conectada de cada grupo y la enfoca al pulsar. El control de paleta cambia a colores por tipo y filtros de visibilidad. Los grupos ayudan a navegar, no crean hechos ni vínculos. Hover muestra título completo y extracto; los vecinos seleccionados se resaltan. Posiciones, cámara y selección sobreviven a cambios en vivo. Reorganizar calcula explícitamente otro diseño por fuerzas. El cálculo usa un worker; la GPU dibuja solo tras cambios y pausa fuera de pantalla. Sin vínculos inventados ni animación continua en segundo plano. Usa Fuentes si WebGL no está disponible.
Elegir un proveedor de vídeo sin cambiar el flujo de imágenes
Usa fal.ai, BytePlus ModelArk o Higgsfield con cuentas, contratos y presupuestos separados.
- Abre Imágenes > Flujo de vídeo en Canvas o Workbench. Los borradores existentes siguen usando fal.ai. Crea referencias y storyboards con el flujo existente de la suscripción Codex; esta función no envía la generación de imágenes a otro proveedor.
- En el nodo de vídeo, abre Configurar acceso > Nueva cuenta. Elige el proveedor antes de introducir su credencial: clave fal, clave API de BytePlus ModelArk o KEY_ID:KEY_SECRET de Higgsfield. Guárdala en la bóveda cifrada de la aplicación. Después habilita este workspace, medios externos, modelos permitidos, reservas por ejecución/día en USD y acceso opcional de agentes. Una suscripción web no implica saldo API ni acceso al modelo. No se puede cambiar el proveedor de una cuenta existente; crea otra cuenta.
- Selecciona Proveedor de vídeo, Modelo y una Cuenta correspondiente en el nodo. fal.ai mantiene su catálogo online; BytePlus y Higgsfield usan contratos revisados y versionados. Nombres iguales no implican resoluciones, duraciones, audio ni referencias iguales: H3 en Higgsfield expone 2K, no la opción 768p de fal. Cambiar de proveedor reinicia parámetros incompatibles y cuenta tras confirmar, conservando referencias obligatorias y personajes aprobados para reasignar entradas. Revisa entradas, diálogos y audio. Guarda antes de estimar.
- Las tarifas de la lista se identifican como estimaciones públicas cuando corresponde, con fecha de verificación. No asumen promociones ni son presupuestos finales. Estimar en Higgsfield sube las referencias locales autorizadas y cotiza la entrada exacta para esa cuenta; no genera vídeo. BytePlus estima tarifas por tokens, duración y resolución, considerando conservadoramente la duración desconocida de vídeos de entrada y una reserva de 4x. fal conserva su estimador actual. Ninguna estimación ni reserva local garantiza la factura final del proveedor. Genera explícitamente tras revisar datos salientes, coste y permisos.
- Cada ejecución congela proveedor, cuenta y contrato. Recargar retoma el mismo trabajo remoto, sin cambiar modelos silenciosamente ni repetir un envío de pago incierto. Reintentar descarga no vuelve a generar. BytePlus acepta imágenes/audio locales pero este adaptador exige URLs HTTPS públicas para vídeos de entrada; Orkestrai no los publica en otro servicio automáticamente. Ofrece generación por referencias, no edición/extensión directa. Tras enviar, se deshabilita cancelar en BytePlus porque su endpoint de eliminación puede borrar resultados terminados; aún puedes cancelar elementos en la cola local. Higgsfield ofrece los endpoints revisados de texto/imagen/referencia/edición/extensión donde se indican. Revisa imagen y sonido antes de aprobar.
- Los agentes consultan video_workflow_models con input.provider y después el input.endpoint exacto; configuran config.provider y profileId correspondiente al crear/editar. Mantienen tarea asignada, permisos del propietario, vista previa/revisión e idempotencia. Los nuevos proveedores no autorizan gastos ni conceden credenciales automáticamente. Cambiar proveedor/modelo requiere acuerdo del propietario; las referencias de voz y personaje no garantizan una consistencia generativa perfecta.
- Referencias del vídeo muestra nombres y vistas previas tanto de medios del canvas como de archivos del proyecto sin nodo propio. Elige la función (primer fotograma, último fotograma, imagen de referencia, vídeo o audio) y selecciona medios del canvas o usa Elegir del proyecto para navegar por carpetas. Ver referencia abre una vista más grande sin salir del flujo. Los números empiezan en 1 y representan posiciones de entrada del modelo, no nombres de archivos. Detalles técnicos contiene el mapeo exacto de la API y la ruta relativa editable. Ver un archivo no crea un nodo ni reescribe el vínculo del agente. Los agentes usan los mismos vínculos; la app no adivina referencias ausentes ni inicia generaciones de pago automáticamente. El adaptador sube o codifica las entradas en la etapa de cotización/generación indicada.
Montar y exportar una secuencia de vídeo
Ordena, recorta y subtitula vídeos existentes sin cambiar sus archivos originales.
- Abre Imágenes > Secuencia de vídeo en Canvas o Workbench. Añade nodos Vídeo del workspace (MP4, WebM o MKV). Instala el codificador una vez desde el nodo: el propietario confirma una descarga separada y versionada de FFmpeg verificada con SHA-256. No requiere Homebrew, clave API ni generación de pago.
- Selecciona un clip en la lista vertical. Sube/baja, ajusta entrada/salida, nivel de audio y subtítulo, y Guarda. Quitar un clip solo lo elimina de la secuencia. El hash de origen queda fijado; un archivo modificado o ausente bloquea la exportación. Elige salida horizontal, vertical o cuadrada y 24/25/30 fps. El ajuste conserva todo el contenido con bandas negras, sin recortar ni estirar. Los subtítulos se graban dentro de márgenes seguros del 10%.
- Reproducir secuencia muestra los recortes ordenados. Exportar MP4 crea un H.264/AAC en generated/videos/sequences y un nodo Vídeo conectado. Revisa imagen y sonido. La exportación conserva su revisión e indica si es anterior a las ediciones. Exportando no significa entregado; errores e interrupciones quedan visibles. Cancelar detiene el codificador sin cambiar originales. Los temporales propios se eliminan tras éxito/error/cancelación y los directorios abandonados antes de la próxima exportación. Usa Pantalla completa en la vista previa para revisar clips verticales y subtítulos a un tamaño legible y volver al mismo editor.
- Los agentes usan video_workflow_sequences u orkestrai video sequences con tarea asignada. Lee la revisión antes de apply/export; repite peticiones con timeout usando la misma UUID idempotencyKey. Solo el propietario instala el runtime. Límites: 30 clips, 10 minutos, dimensiones pares de 240 a 1920 por lado, una exportación a la vez, al menos 3 GB libres y salida acotada. Transfiere la secuencia con todos sus nodos de Vídeo originales. Las imágenes Codex ImageGen y la generación fal siguen separadas; esto monta vídeos entregados, no es otro modelo generativo.
Reutilizar flujos creativos y consultar la cola
Guarda guiones versionados con entradas nombradas y recrea storyboards editables sin copiar permisos de ejecución.
- Abre Imágenes > Flujos creativos en Canvas o Workbench, o Guardar flujo en el encabezado de un Storyboard. Guardar flujo captura la revisión guardada actual, el orden de escenas, dirección, diálogos, duración y encuadre. Dale un nombre y selecciona opcionalmente un flujo existente para crear una nueva versión inmutable. Los cambios sin guardar no se capturan. video_workflow_recipes también acepta un grupo con exactamente un storyboard: captura ese tablero, no notas, agentes ni automatizaciones independientes. No guarda archivos, historial de ejecuciones, sesiones, credenciales ni permisos de gasto.
- En Biblioteca, elige una versión, introduce el brief/guion, la proporción de salida y, opcionalmente, el agente Codex de imágenes. Vincula cada entrada de producto/referencia a una imagen o video del workspace actual y cada personaje a una versión local aprobada. Las identidades coincidentes pueden preseleccionarse por familia, versión y hash exactos. Solo el propietario puede elegir deliberadamente otro personaje aprobado; los agentes deben conservar la identidad guardada. Importa primero el personaje desde su biblioteca si hace falta. El propietario puede reutilizar flujos de otro workspace; los agentes no pueden explorar ni leer otros workspaces.
- Crear storyboard editable añade contenido nativo normal con nuevos IDs de escena y sin enlaces a ejecuciones anteriores. El guion sustituye el texto literal {{script}} una sola vez, sin evaluación recursiva; si la dirección no contiene ese marcador, se añade el brief. Un guion requerido vacío o una entrada ausente bloquea la creación. Abre el storyboard, revisa cada escena y prepara los borradores de imagen/video por separado. Las dimensiones de imagen pasan por el flujo Codex existente; la duración y proporción de video deben estar declaradas por el endpoint elegido o la preparación se detiene. La generación, validación de alpha, estimación, presupuesto y gates existentes siguen vigentes.
- La Cola de generación actualiza los estados reales de imagen/video del workspace mientras está abierta. Muestra borradores, errores, posición del proveedor, reserva en USD y enlaces a resultados, sin porcentajes inventados. Abrir flujo permite usar sus controles normales de estimación, permisos, revisión y generación. Cancelar usa el ejecutor existente; Reintentar descarga solo recupera un resultado remoto ya creado. Los envíos pagados inciertos no se repiten automáticamente. Tener algunos resultados completos no significa que todo el storyboard terminó. Eliminar una versión guardada nunca elimina los storyboards creados ni sus archivos.
Planificar escenas en un guion gráfico nativo
Escenas ordenadas, identidades aprobadas y borradores conectados de imagen/video en Canvas y Workbench.
- Abre Imágenes > Guion gráfico en Canvas o Workbench. Añade una escena y define título, dirección, diálogo, idioma y duración deseada. Selecciona la versión exacta del personaje aprobado y las imágenes/clips de referencia locales; elige un ejecutor Codex para generar imágenes. Guarda antes de cambiar de escena. Duplicar inicia un borrador sin reutilizar enlaces de ejecución. Arrastra las escenas para ordenar o usa Subir/bajar. Eliminar una escena conserva sus flujos y archivos entregados.
- Preparar borrador de imagen crea un flujo Codex existente conectado, sin ejecutarlo. Se admiten hasta cinco referencias, incluidas todas las imágenes maestras de los personajes seleccionados; el exceso genera un error explícito, sin descartar referencias. Abre el borrador y usa sus controles normales de generación. Preparar borrador de video crea un flujo fal nativo sin cobrar. Elige un endpoint permitido, vincula todos los personajes y referencias obligatorios, revisa las capacidades reales de duración/audio y usa Guardar > Estimar > Generar. Una duración no admitida se rechaza, nunca se acorta silenciosamente. Preparar la misma escena sin cambios reutiliza su borrador. Para elegir otro, desvincula y vuelve a preparar.
- Cambiar una escena marca sus borradores como desactualizados; los resultados permanecen intactos. Las ediciones manuales y video_workflow_storyboards usan el mismo documento con revisión. Las escrituras simultáneas fallan con conflicto; tus cambios locales permanecen visibles hasta descartarlos y recargar. Los guiones copiados conservan los IDs de referencias/personajes ausentes para reparación local explícita; nunca heredan permisos de cuentas. Revisa imagen y sonido reales antes de aprobar. Una referencia de voz aprobada no garantiza que todos los modelos puedan reproducirla.
Compara y aprueba variantes creativas
Abre Comparar y revisar en la cabecera de un nodo Imagen o Video, o en un Storyboard. Mismo flujo limita las miniaturas a resultados relacionados; desactívalo para comparar otros archivos locales. Elige A y B en los selectores con búsqueda o pulsa una miniatura para B. Abrir resultado localiza el nodo original en Canvas. Los pares de videos comparten reproducción, pausa y búsqueda hasta la menor duración común; alterna el sonido entre A y B. Un video individual usa controles nativos. Las imágenes se ajustan sin recortes. No se pueden aprobar archivos ausentes o que no se puedan reproducir. Compara rostro, vestuario, encuadre, idioma y voz real con las referencias aprobadas; una generación completada no garantiza consistencia. Escribe comentarios y elige Aprobar, Solicitar cambios o Rechazar. El historial conserva cada decisión, autor, fecha, comentario y huella del archivo. La aprobación vincula los bytes exactos, la procedencia y las versiones congeladas de personajes disponibles. Un archivo modificado invalida la decisión; las revisiones concurrentes requieren recargar. Los agentes usan video_workflow_assets list/inspect/decide y solo pueden proponer una decisión, nunca aprobar su propio resultado. Estas acciones no llaman a fal ni a ImageGen ni consumen créditos.
- Abre las variantes
- Compara imagen y sonido
- Registra una revisión
Crea una nueva dirección desde una imagen
Abre Acciones creativas en la cabecera de un nodo Imagen. Elige Variación, Quitar fondo, Cambiar región o Animar. El original nunca se sobrescribe. Cada acción congela los bytes exactos en generated/creative-actions y conecta una referencia y un flujo nativo nuevo. La procedencia incluye nodo original, hash y contexto de generación. Variación y Cambiar región admiten dirección y 1–10 resultados. Elige un agente Codex o asígnalo en el flujo creado. Para Cambiar región, arrastra un rectángulo sobre la imagen real o ajusta X, Y, ancho y alto con controles accesibles por teclado. El servidor verifica las dimensiones originales. El rectángulo orienta el prompt; no es una máscara estricta ni garantiza conservar cada píxel exterior. Preparar borrador no genera ni cobra. Abre el flujo de imagen y usa la suscripción Codex existente; quitar fondo exige transparencia RGBA real y conserva la validación y reparación existentes, sin edición local de píxeles. Animar crea un borrador de video: elige cualquier modelo permitido compatible, asigna la imagen congelada y todos los personajes requeridos, guarda, estima y ejecuta explícitamente. Una referencia congelada ausente o modificada bloquea su uso. Cancelar antes de preparar no crea nada; eliminar el borrador nunca borra el original. Los agentes usan video_workflow_assets command=prepare con expectedDigest verificado y edit.operation; ambas interfaces comparten la validación.
- Elige una acción de imagen
- Define dirección o región
- Revisa el borrador conectado
Reutiliza un kit de marca aprobado
Versiona paletas, logotipos, productos y reglas creativas y coloca los recursos exactos en cualquier workspace.
- Abre Imágenes > Kits de marca en Canvas o Workbench. En Este workspace, nombra el kit, elige colores y valores hexadecimales, añade imágenes de logotipo/producto/estilo y escribe el brief, el tono y las reglas de uso. Los recursos deben ser archivos PNG, JPEG o WebP locales; exporta primero los logotipos vectoriales mediante Design. Guarda el borrador antes de aprobar.
- Revisa los archivos reales y usa Aprobar y fijar kit. La aprobación congela copias en generated/brands con hashes SHA-256. Las versiones aprobadas no pueden editarse ni eliminarse como borradores; crea otra versión para modificarlas. Las revisiones en conflicto o archivos modificados detienen la operación sin sobrescribir otra edición. La paleta y las reglas también pueden formar un kit sin imágenes.
- Usa Biblioteca aprobada > Añadir kit al Canvas en cualquier workspace. La versión exacta se convierte en un grupo nativo, una nota de reglas y nodos de imagen conectados. Las copias son independientes del proyecto original; no se transfieren cuentas, tokens ni permisos de generación. Conecta la nota y las imágenes pertinentes a los flujos existentes de imágenes Codex o vídeo fal, respetando el límite de referencias. Los agentes usan video_workflow_brands para crear/leer/derivar/colocar kits locales; solo el usuario aprueba o importa entre workspaces. Estos recursos no garantizan resultados generativos idénticos píxel por píxel: revisa la salida.
Dirigir el encuadre y el movimiento de cámara
Guarda la dirección de cada escena sin perder referencias ni vínculos de voz.
- Abre una escena del Storyboard o un Flujo de vídeo y usa Dirección de cámara. Elige encuadre, ángulo, movimiento y ritmo. Los controles persisten en la escena y su borrador de vídeo; los borradores de imagen reciben encuadre y ángulo, sin movimiento de cámara.
- Estos controles expresan intención creativa en el prompt, no una trayectoria garantizada. El primer y último fotograma y los demás campos dependen del contrato declarado por el endpoint. La duración debe coincidir exactamente con un valor compatible; los valores incompatibles o ambiguos detienen la preparación en vez de acortar el clip silenciosamente.
- Cambiar de modelo conserva la dirección, los vínculos de personaje y voz, las referencias de archivo y los parámetros. Los adaptadores incompatibles rechazan el cambio; los endpoints genéricos exigen reparar mapeos incompatibles antes de estimar. Las referencias obligatorias siguen siendo obligatorias hasta revincularlas explícitamente. Los agentes usan el mismo objeto shot en las operaciones de escena de video_workflow_storyboards y la configuración del vídeo.
Flujos de video con fal.ai
En Canvas, abre el menú Imagen y elige Agregar flujo de video. El mismo nodo abre en Workbench. La generación de imágenes con la suscripción Codex sigue sin cambios y no requiere una clave API. Video es una integración de pago opcional con fal.ai: abre Configurar acceso en el nodo, guarda la clave en la bóveda del app, activa la cuenta y este workspace, autoriza el envío externo de prompts/imágenes, selecciona modelos y configura límites de reserva en USD y concurrencia. Los agentes también necesitan el permiso del workspace, un terminal activo autenticado y una tarea asignada.
- Storyboard a video: Codex escribe orden de escenas, prompts, diálogos, idioma y dirección sonora en Notas. Los flujos Codex/GPT Image existentes crean todos los personajes, storyboards y referencias visuales. Solo se suben referencias aprobadas a fal para generar video; fal no crea esas imágenes. Activa audio nativo únicamente si el contrato del modelo lo admite. Seedance 2.5 reference-to-video acepta referencias de imagen/audio y generate_audio; el habla nativa no es una voz TTS de Orkestrai, y su comportamiento depende del modelo.
- La Biblioteca de personajes guarda borradores y versiones bloqueadas por el usuario: apariencia, 1–12 imágenes maestras y un audio aprobado o ID de voz existente, limitado a cuenta y endpoints compatibles, además de idioma y estilo. Aprobar copia archivos locales a generated/characters, registra hashes SHA-256 y hace inmutable la versión. Los cambios crean otro borrador sin reescribir escenas. Los agentes pueden proponer y leer versiones, pero no aprobar, eliminar versiones bloqueadas ni sustituir silenciosamente la identidad de una escena.
- Vincula una versión aprobada exacta a cada escena y asigna sus imágenes y voz a campos compatibles. El servidor inyecta referencias congeladas y rechaza archivos ausentes/modificados, vínculos en conflicto, cuenta/modelo incompatible o audio desactivado antes de generar. Una escena transferida conserva IDs de personajes sin resolver y no se ejecuta en otro workspace hasta vincular identidades locales aprobadas. Los snapshots conservan versiones y hashes. Fijar entradas no garantiza consistencia generativa del 100%: imagen, habla y sincronización labial necesitan revisión humana. No se registran voces automáticamente ni se puntúa consistencia. Monta los clips entregados con el nodo nativo Secuencia de vídeo.
- Abre el menú Imágenes, elige Personajes y arrastra un personaje aprobado a un área vacía del Canvas de destino o usa Añadir al Canvas. La biblioteca se comparte entre workspaces locales. Orkestrai copia todas las imágenes bloqueadas y la muestra de voz, conserva versión y hash, y crea una Nota de identidad e Imágenes de referencia agrupadas sin modificar el origen. Los IDs de voz conservan su cuenta original, pero nunca se copian credenciales ni permisos del workspace. Workbench ofrece la misma biblioteca y Añadir al Canvas. Los agentes pueden colocar personajes locales aprobados; importar desde otro workspace requiere al usuario.
- Elige el personaje aprobado por nombre: la escena muestra imágenes maestras y muestra de voz y asigna todas las referencias a entradas convencionales declaradas por el modelo. No se descarta ninguna referencia para ajustarse. La asignación avanzada sigue disponible para contratos diferentes. Escribe @ en Dirección o usa Insertar referencia de personaje para insertar un nombre guardado como @{nombre}; permanece vinculado al ID exacto de la versión. Eliminar un personaje citado o usar un nombre desconocido bloquea la generación, sin cambiar el sujeto silenciosamente. Los agentes pueden solicitar la misma asignación conservadora con video_workflow_characters command=binding y la configuración actual.
- Busca el catálogo completo de video publicado por fal.ai, incluyendo Seedance 2.5 y endpoints de texto, imagen, referencias, audio y video. Orkestrai lee el contrato OpenAPI oficial del endpoint seleccionado, conserva tipos, opciones y parámetros anidados y fija ese contrato en cada ejecución. Aparecer en el catálogo no garantiza acceso con la cuenta. Los endpoints retirados y contratos inválidos no pueden generar.
- En los modelos del catálogo, usa Medios del workspace para vincular un nodo de Imagen/Video o un archivo relativo al workspace a un campo como /image_urls/0 o /elements/0/frontal_image_url. Los vínculos tienen orden y hash y se verifican antes del envío; los bytes no se guardan en el JSON. Los parámetros anidados tienen editor JSON y referencia del contrato. Se admiten hasta 50 vínculos, 10 MB por imagen, 64 MB por audio/video y 100 MB en total; el proveedor puede imponer límites menores. Al copiar entre workspaces se reasignan los nodos seleccionados y se eliminan los vínculos solo por archivo.
- Las unidades de facturación normalmente corresponden a la duración o una salida. Para endpoints cobrados por tokens, fotogramas, cómputo o duración automática puede ser necesario indicar la cantidad estimada. Revisa los precios del endpoint y configura límites en la cuenta. La reserva local no es un límite de cobro impuesto al proveedor.
- Wan 2.7 genera video desde texto, con 2–15 segundos, 720p/1080p y relaciones de aspecto enumeradas. Kling 3 Pro anima una Imagen seleccionada como primer fotograma, con fotograma final opcional, durante 3–15 segundos. Sus referencias deben ser PNG/JPEG/WebP, mínimo de 300 px por lado, hasta 10 MB y proporción entre 0,4 y 2,5. Solo se muestran controles compatibles. La voz de Kling admite inglés y chino; Wan puede crear audio de fondo automáticamente.
- Selecciona Notas de contexto explícitamente; su texto forma parte del prompt enviado. Elige imágenes inicial/final por identidad del nodo. Las conexiones comunes de colaboración no ejecutan otras ramas. Guarda, estima el costo, revisa la estimación base y la reserva y genera. La reserva local es cuatro veces la estimación por unidad como margen, no un límite garantizado de la factura externa. Configura límites también en fal.ai. Los controles de Seguridad del workspace pueden requerir aprobación para operaciones de pago.
- Las ejecuciones se guardan antes del envío. Tras reiniciar, Orkestrai consulta el job remoto guardado en vez de generar de nuevo. Si se pierde la respuesta del envío de pago, la ejecución queda sin confirmar y no se repite automáticamente. Revisa la cola/cuenta fal.ai antes de otra acción. Cancelación solicitada no significa cancelación confirmada ni reembolso; el resultado puede terminar primero.
- Cada salida declarada de vídeo/audio se descarga sin cambios a la carpeta elegida del workspace, con límites de tamaño y SHA-256, y aparece como un nodo reutilizable separado. MP4, WebM, MOV, MKV, GIF y contenedores de audio compatibles conservan su formato original; la reproducción depende de los códecs del navegador instalado, y la descarga sigue disponible. Reintentar una descarga nunca genera de nuevo. No se recorta, estira ni recodifica. Eliminar nodos conserva los archivos. Las ejecuciones pagadas activas bloquean transferencias y eliminaciones.
- Las claves permanecen en la bóveda segura del escritorio. Ninguna clave de cuenta ni enlace firmado de medios generado entra en los nodos o respuestas a agentes. Los archivos locales se suben solo después del gate de ejecución del workspace, solicitando ACL privada y caducidad de 24 horas; los enlaces temporales de lectura se pasan solo al endpoint elegido. Se desactiva el almacenamiento JSON de solicitudes en fal. Las salidas compatibles solicitan una hora de retención y ACL privada. Esto no garantiza la retención de proveedores upstream. Envía solo material que puedas compartir y conserva los archivos descargados.
- Los agentes usan video_workflow_models/list/read/create/update/preview/run/cancel/retry_download/remove u orkestrai video. List muestra perfiles permitidos y capacidades, nunca credenciales. Usa la revisión y el ID de preview devueltos con una clave UUID de idempotencia estable. Una ejecución en cola no es un video entregado. No uses HTTP directo para saltar políticas. No se admite Runway directo ni JSON ComfyUI arbitrario. Los flujos creativos reutilizan storyboards nativos y Secuencia de vídeo monta los clips entregados localmente.
- El selector incluye el catálogo público, no garantiza que todos los endpoints listados sean utilizables. Algunas entradas no publican contrato OpenAPI de cola, usan streaming en tiempo real, están obsoletas o devuelven 404. No se ejecutan con el adaptador de cola; los errores de contrato aparecen antes de una solicitud pagada. El catálogo incluido se actualiza desde fal y cada modelo elegido usa su contrato actual validado.
- Una ejecución admite hasta 10 salidas de vídeo/audio. Cada archivo se descarga sin redimensionar ni transcodificar y vuelve a comprobar exclusiones de carpetas, tamaño y permisos de red antes de publicarlo. Si falta una aprobación o se revocó el acceso, se conserva el trabajo pagado y Reintentar descarga recupera el resultado sin generarlo de nuevo. Las referencias FLAC se admiten junto con WAV, MP3, Ogg y M4A.
- Seleccionar un modelo carga su contrato oficial de cola. Los campos incluyen descripciones del proveedor, ejemplos sugeridos y valores predeterminados visibles. Los ejemplos son sugerencias, no una lista cerrada de valores válidos. Objetos y listas tienen controles anidados; JSON sigue disponible para contratos avanzados o ambiguos. La reescritura del prompt aparece junto a los controles principales con una advertencia: cambia la dirección, no la velocidad de renderizado. Los borradores anteriores ofrecen Editar todos los parámetros del modelo para convertirlos explícitamente al endpoint completo, conservando dirección y referencias. Los parámetros incompatibles con un nuevo modelo siguen visibles para eliminarlos o reasignarlos, nunca se descartan silenciosamente.
- Selecciona una cuenta configurada para comparar tarifas base y unidades de cobro en el selector. Solo se consultan los modelos mostrados, con caché de hasta cinco minutos separada por cuenta; los precios ausentes figuran como no disponibles, nunca cero. No son presupuestos finales de la configuración: resolución, audio y otros multiplicadores pueden cambiar el coste. Estimar coste sigue validando borrador, referencias y presupuesto antes de generar. Consultar precios no envía trabajos ni reserva dinero. Los agentes usan video_workflow_models con endpoint para el mismo esquema documentado, o pricingIds (hasta 50) y profileId para las tarifas permitidas; nunca reciben credenciales.
Abre la carpeta de entrega
Pide al agente que abra generated/images/xyz-carousel. Usa fs_open_folder, u orkestrai fs open-folder "generated/images/xyz-carousel", para abrir la carpeta existente en Finder, Explorer o el gestor de archivos Linux del host. No requiere Computer Control, Accesibilidad ni Grabación de Pantalla. Admite carpetas de @alias registrados; no admite archivos, URLs, bundles ejecutables, rutas fuera del directorio permitido ni permisos nuevos. Las restricciones explícitas de archivos y la parada de emergencia siguen vigentes. La operación se audita y confirma que el sistema operativo aceptó la solicitud, sin afirmar inspección visual. Si la sesión es anterior a la tool MCP, el agente puede usar la CLI.
Respuestas automáticas a una conversación autorizada
Activa Seguridad Delimitada con las capacidades computer y agent. En el nodo Computadora existente, abre Respuestas en conversaciones y lee la ventana nativa autorizada. Selecciona una tarea activa asignada, la CABECERA real de la conversación (nunca el contacto lateral), el campo del mensaje y Enviar. Selecciona el prefijo de mensaje recibido exactamente como aparece en accesibilidad nativa, incluyendo el remitente; la etiqueta debe distinguir recibidos de mensajes propios e idealmente incluir su hora. Define límites de longitud y cantidad por hora. Solo el usuario crea, activa o revoca esta autorización; no permite publicar en toda la app. Crea una automatización Manual habilitada de tipo prompt_agent para el mismo agente. Las automatizaciones manuales permanecen habilitadas entre eventos; no añadas consultas programadas. En observación, selecciona la ventana nativa exacta, tarea y autorización de conversación, usa Automático y activa Monitorizar. Cambiar el foco a otra app ya no pausa la observación nativa. La lectura sigue vinculada al proceso y la ventana autorizados; cambiar la conversación seleccionada, cerrar la ventana o revocar el acceso aún impide el procesamiento. Observar no activa la ventana, no hace clic ni escribe. La accesibilidad nativa debe exponer mensajes completos y sin ambigüedad; esto no importa por API todo el historial de la aplicación. Apps sin soporte/Linux no pasan silenciosamente a envíos automáticos por coordenadas. La primera observación establece una referencia. Los nuevos mensajes recibidos y observados entran en una cola local persistente, incluso mientras el agente está ocupado. El intervalo corto configurado agrupa preguntas consecutivas. El evento incluye grantId, batchId, inReplyToDigest y TODOS los mensajes del lote. El agente lee en orden, separa temas y responde cada pregunta usando computer_reply con esos campos, targetId, taskId, idempotencyKey y la respuesta completa. Los pedidos pendientes permanecen en la tarea/notas existentes; aceptar un pedido no significa completarlo. La misma sesión del agente mantiene el contexto. Cada lote admite hasta 20 mensajes y 60.000 caracteres; el exceso queda pendiente, sin recorte silencioso. La cola admite 128 mensajes no resueltos y se bloquea con un error si se llena. Orkestrai valida el mensaje nativo recibido antes de escribir. Durante la composición y el envío, destinatario autorizado, permiso, foco y borrador completo siguen protegidos; el mensaje original no necesita permanecer visible ni mantener el mismo índice en el historial. Los mensajes nuevos siguen pendientes mientras se responde un lote ya recibido. Borradores humanos, destinatario modificado, autorización revocada o entrada ambigua detienen la operación. En macOS, la entrada nativa dirigida al proceso actualiza el campo real; los editores multilínea usan Shift+Return para los saltos, nunca un salto sin modificador. Proceso, ventana y límites se verifican durante la entrada. Un comando exitoso confirma el envío nativo del lote, no su entrega/lectura. Un fallo parcial o incierto permanece bloqueado para inspección; no repitas ni afirmes que nada se envió sin comprobarlo. El panel muestra mensajes pendientes, estado del observador y tiempo local medido por separado del tiempo de generación del proveedor. El texto de la cola se guarda en la base local del app, fuera del repositorio del workspace: los mensajes no resueltos permanecen hasta atenderse; hasta 64 mensajes enviados quedan como contexto durante un máximo de 14 días mientras se ejecuta la observación. Hasta 4.096 hashes recientes evitan observaciones duplicadas. La auditoría guarda conteos/hashes, no texto de conversación; los transcripts del proveedor tienen retención propia. Reiniciar recupera mensajes ya observados y encolados, pero no garantiza recuperar los que la interfaz nativa nunca expuso. Las respuestas de texto no autorizan adjuntos, acceso a archivos ni generación a petición del contacto; entregar imágenes generadas requiere una integración propia autorizada por el usuario. Los builds locales siguen siendo ad-hoc; los permisos del sistema pertenecen al usuario y nunca se eluden.
Un asistente que recuerda y programa trabajo
Empiece con una tarea activa asignada al agente del Canvas y la autorización existente de conversación en Computer. Pida ayuda en lenguaje natural; computer_capabilities informa recursos, configuración y permisos sin leer credenciales. Las instrucciones conectan tareas, notas, herramientas publicadas del Taller, integraciones, flujos nativos de imágenes, TTS y PDF. El agente debe consultar herramientas existentes antes de proponer otra y solo puede publicar automáticamente dentro de la política autorizada del Taller. Ejemplo: "Cada lunes a las 14:00, America/Sao_Paulo, prepara mi informe semanal y envía el resumen a esta conversación autorizada." El agente crea una rutina prompt_agent existente mediante automation_save y devuelve su id y próxima ejecución. En Automatizaciones, Programación ofrece intervalo o Calendario con ejecución única/diaria/semanal/mensual, hora local, zona IANA, días/fecha y política de retraso. Omitir permite 60 segundos; Última permite una ejecución reciente dentro del retraso configurado, sin inundar de recordatorios perdidos. Las horas inexistentes por cambio horario se omiten; las repetidas se ejecutan una vez; un día mensual inexistente se omite. El equipo debe estar despierto, el workspace cargado y la autorización activa. Consulte, edite, pause o cancele en Automatizaciones; los agentes solo editan sus rutinas vinculadas a la tarea con la revisión vigente. En Computer > Respuestas de conversación, habilite explícitamente Memoria privada. Solo los mensajes recibidos observados después de la línea base y los envíos nativos exitosos entran en este diario local separado. No es memoria compartida del proyecto ni importa todo el historial de la aplicación. La retención es de 30–3650 días, también limitada a 5000 mensajes/16 MiB por conversación. Hasta 256 hechos con fuentes conservan los fragmentos citados hasta eliminarlos; el agente busca detalles antiguos bajo demanda sin insertar todo el diario en cada prompt. Historial permite al dueño buscar, revisar hechos y eliminar uno o toda la memoria local. No elimina transcripciones del proveedor ni el chat externo. Deshabilitar pausa nuevos registros; eliminar la autorización borra sus registros privados. Las solicitudes largas siguen siendo trazables después del acuse de recibo. Habilite recordatorios y resultados para ese contacto exacto para permitir computer_send sin un nuevo mensaje recibido. Exige una tarea asignada o ejecución de automatización como origen, deduplica ese origen tras reinicios y usa las mismas verificaciones de foco, destinatario, borrador vacío, límite horario y riesgo. Cambiar permisos entre escribir y enviar detiene la publicación. Los mensajes recibidos nunca autorizan nuevos contactos, aplicaciones, archivos ni compras. Despachar una rutina o vaciar el campo de texto no prueba la entrega del informe. artifact_speech reutiliza el TTS configurado para crear WAV en el workspace; artifact_report crea PDF; artifact_inspect verifica ruta, formato, tamaño y SHA-256. Las imágenes conservan el flujo Codex existente, sin nueva clave API. En Computer > Respuestas de conversación > Adjuntos nativos, el propietario autoriza el selector, elemento de menú opcional, Enviar de la vista previa, formatos y tamaño para ese contacto. computer_media_send usa un digest recibido o una tarea/ejecución autorizada, una copia privada inmutable y verificaciones del destinatario exacto y nombre del archivo en la vista previa. Cambiar la clave no repite un envío incierto. El original permanece intacto; las copias temporales tienen un límite de 100 MiB y caducan a los 15 minutos. Recibir exige autorización separada: seleccione el control Descargar del mensaje y prefijos opcionales de medios recibidos. computer_media_receive guarda en una NUEVA ruta autorizada del workspace, valida formato/hash y nunca ejecuta contenido recibido ni sobrescribe archivos. Descargar debe pertenecer exclusivamente a ese mensaje. El selector nativo actualmente admite diálogos estándar adjuntos a la ventana en macOS; no se declara validación de diálogos personalizados ni otros backends. La carga/descarga del Portal sigue separada bajo permisos existentes del navegador. WAV de TTS es un archivo de audio adjunto, no una nota de voz grabada nativamente. artifact_transcribe usa STT existente para WAV PCM16; el app instalado también decodifica Ogg/Opus, MP3 y M4A con Chromium, limitado a 10 MiB y 10 minutos, sin Python, carga externa, micrófono ni otra ventana. El codec se verifica al ejecutar. Preparado, enviado al cliente, recibido y entregado son estados distintos; importar no significa comprender su contenido. La redacción interrumpida tiene un reintento limitado solo antes de Enviar y para un prefijo exacto de la respuesta autorizada. Inspeccionar respuesta interrumpida permite al propietario revisar un borrador fallido anterior y autorizar la reanudación de la solicitud original, sin reescribir su contenido ni publicar durante la recuperación. Un destinatario o borrador cambiado, o cualquier intento registrado de Enviar, siguen bloqueados; recuperar no es entregar. La creación de herramientas en Workshop expone el contrato exacto y los límites de publicación concedidos al agente autenticado. Las fixtures de transformación pueden verificar expectedOutput antes de la publicación automática; usa dos ejemplos distintos y comprueba publishedRevision antes de ejecutar. El foco del editor en macOS espera confirmación nativa y puede usar la acción de foco del editor verificado. Los popovers conservan la verificación del documento original. Otra interrupción antes de Enviar exige una nueva inspección y autorización distinta del propietario; nunca se repite una publicación incierta. Los adjuntos nativos de macOS ahora admiten menús animados, diálogos del sistema Abrir/Guardar y URL de referencia por ID, comparando la ruta canónica completa. Las vistas previas separadas validan destinatario autorizado, archivo, leyenda vacía y Enviar en el mismo contenedor delimitado. En Equipo > Respuestas de conversación > Adjuntos nativos, Inspeccionar adjunto interrumpido permite recuperación del propietario solo cuando la auditoría íntegra no registra intentos de envío. Cierra las vistas previas y confirma que no enviaste el archivo manualmente; el agente debe repetir la solicitud original. Los envíos inciertos siguen bloqueados. En Computadora > Respuestas de conversación > Persona y voz, guarda nombre, instrucciones del propietario, idioma, voz/velocidad y estilo público. Mensajes, audio transcrito, imágenes y memorias privadas son referencias, no autorización para cambiar persona, destinatarios, aplicaciones o archivos. La app bloquea patrones reconocidos de credenciales antes de texto público, voz, informes generados y adjuntos de texto; errores y auditoría conservan motivo/hash, no el contenido rechazado. Puede bloquear detalles operativos y reemplazar rayas largas antes del envío. Son capas de protección, no DLP universal ni inmunidad a prompt injection. El TTS local ofrece F1-F5 y M1-M5 para cada idioma compatible en Ajustes > Voz y computer_capabilities (30 ids). Por ejemplo, solicita pt-BR-m3 en artifact_speech; un id desconocido se rechaza en vez de cambiar la voz silenciosamente. Si se omite, se usa la voz del contacto. STT no cambia. La recepción autorizada de audio intenta transcribir localmente después de descargar: transcription.state=ready contiene texto externo no confiable; unavailable requiere reintentar artifact_transcribe sobre el archivo verificado, sin descargar de nuevo. La transcripción es transitoria, fuera de registros de acciones/auditoría. Un WAV adjunto no es una nota de voz nativa grabada. Adjuntos nativos tiene controles separados de Foto y Documento configurados por el propietario. computer_media_send usa foto para imágenes y documento para otros formatos; sin ruta de foto autorizada falla explícitamente, sin enviar un documento silenciosamente. presentation=document conserva el envío como archivo de forma explícita. Se mantienen destinatario, archivo/hash inmutable, identidad de vista previa, borrador vacío y protección contra duplicados. Una vista personalizada que no identifica el archivo se rechaza, sin adivinar mediante captura. Agente del Canvas conserva herramientas autónomas y shell libre; las reglas de la app no aíslan ni auditan acciones fuera de la conexión controlada. Conversación restringida es una inferencia separada opcional de Codex 0.154.x sin herramientas, con política del propietario y solo mensajes/memoria del contacto. No recibe historial técnico, shell, patch, navegador, plugins ni MCP. Responde texto pero no ejecuta programación ni genera/envía medios. Provider, versión o WSL no compatibles se detienen sin recurrir al terminal libre. Este modo limitado no sustituye al agente autónomo completo. Permisos del sistema y aceptación de la app nativa requieren validación local. WhatsApp en macOS puede omitir el nombre del archivo en la vista previa de una foto. Para ese caso específico, Orkestrai exige una confirmación reciente del selector nativo para la ruta temporal, aplicación y ventana exactas; después comprueba de nuevo el destinatario autorizado, una sola foto, el contador de un elemento y el pie vacío al enviar. Se rechaza una confirmación de otro archivo/ventana o una vista no verificada. Esto no relaja las comprobaciones de Documento ni convierte el envío solicitado en confirmación de entrega. Una decisión de no responder también debe resolver su lote despachado de entrada. Tras leer todos los mensajes, el agente usa computer_inbox_acknowledge con batchId/inReplyToDigest exactos y el motivo already_answered o no_response_needed. La decisión queda auditada como skipped con sent=false, no como respuesta entregada. Las nuevas llegadas pendientes se conservan y pueden continuar inmediatamente; otro contacto/tarea, un envío incierto o un lote ya respondido no pueden liberarse de esta manera. Decir solamente en el terminal que no hace falta responder deja la cola pendiente. En Computer > Respuestas en la conversación, habilita Foco temporal para enviar y Buscar y reabrir este contacto automáticamente para autorizar la navegación nativa en macOS. Si se selecciona otro chat, el monitor busca al destinatario exacto y verifica la cabecera antes de leer mensajes. La preparación del envío repite la comprobación si la selección cambió mientras el agente redactaba la respuesta. computer_open_conversation ofrece la misma operación limitada al agente asignado; no requiere búsqueda manual ni capturas repetidas. Navegar nunca escribe en el campo de mensajes ni envía, y tiene auditoría separada. Contactos duplicados ambiguos, controles no compatibles, permisos revocados y cabeceras no verificadas siguen bloqueados en vez de seleccionar otra persona. El monitor en segundo plano requiere el equipo despierto y la aplicación autorizada abierta. Los mensajes ya capturados en la bandeja de la conversación siguen disponibles tras reiniciar o reabrir el chat, aunque la aplicación solo muestre el historial reciente. El agente asignado responde con el id y digest originales del lote, sin desplazarse para encontrar preguntas guardadas. El contacto autorizado y el campo de texto actuales se verifican antes del envío. Los envíos inciertos siguen bloqueados y nunca se descartan silenciosamente mensajes sin respuesta. Los eventos nativos de conversación pueden incluir mensajes reenviados y leyendas de archivos, no solo texto. En las etiquetas compatibles de WhatsApp para macOS, Orkestrai verifica la identificación de recepción y el contacto exacto autorizado antes de encolarlos, conservando la etiqueta y el digest originales. Reconocer una notificación de foto, sticker o audio no significa que el agente haya visto la imagen u oído el audio. Puede responder a la leyenda disponible; descargar o transcribir el archivo sigue requiriendo autorización independiente de recepción de archivos. Los mensajes enviados y las copias citadas no deben generar una respuesta.
Observar cambios en apps nativas sin consultar continuamente a la IA
Elige Texto nativo, imagen como alternativa en el nodo Computadora existente. En macOS y Windows, el modo automático lee la ventana autorizada independientemente del foco mediante accesibilidad nativa sin producir PNG. Dos observaciones estables de texto despiertan al operador asignado con una diferencia limitada, sin otra captura ni releer todo el tablero o historial. El intervalo local predeterminado es de un segundo y la pausa entre avisos es de dos segundos; el usuario conserva el control de los valores. El panel muestra la fuente real y la duración de la última comprobación local. Los árboles nativos no disponibles o incompletos utilizan comprobaciones visuales limitadas, separadas por al menos tres segundos. La región y el umbral de píxeles solo afectan a la alternativa visual; la lectura nativa cubre la ventana autorizada. Linux utiliza actualmente la vía visual. En macOS, el estado verifica el permiso del proceso nativo; sustituir la app local puede exigir renovar la autorización de Accesibilidad. El tiempo de detección local no garantiza el tiempo de respuesta del proveedor. Autoriza la aplicación, activa Seguridad Delimitada con las capacidades computer y agent, crea una tarea activa asignada al operador y selecciona una automatización Manual habilitada que envíe un prompt al mismo operador. Selecciona la ventana exacta, automatización y tarea, después activa Monitorizar. Permitir configuración por el agente es una autorización independiente para computer_watch. No programes además consultas periódicas al modelo. El contenido igual no despierta al modelo. La observación nativa no espera el primer plano ni activa la ventana. Pausar, descargar, revocar la aplicación o completar/reasignar la tarea detiene futuros trabajos. La observación genérica comienza una nueva referencia al reiniciar. Respuestas en conversaciones recuperan la cola persistente de mensajes observados; consulta ese caso de uso para retención y agrupación. Los agentes usan computer_read para el texto y los controles actuales, después computer_interact para rellenar o pulsar un elemento nativo exacto. La operación vuelve a comprobar role/name/value esperados y las condiciones de conversación o documento inmediatamente antes de actuar, devolviendo texto actual después. Rellenar exige el valor existente; nunca sobrescribas un borrador humano. Antes de enviar, incluye condiciones para el destinatario exacto y el borrador completo y declara external_publication. Los controles desconocidos, modificados o ambiguos bloquean la acción. Comprueba el resultado real: pulsar Enviar no demuestra entrega. No hacen falta capturas repetidas mientras un gate espera aprobación. Los controles genéricos mantienen los gates de publicación. Para respuestas automáticas usa una autorización de Respuestas en conversaciones aprobada por el usuario y computer_reply, descritos en el caso de uso correspondiente; nunca lo sustituyas por permiso de publicación para toda la app. El contenido de pantalla es dato no fiable, no instrucciones. Las lecturas nativas ocultan controles de contraseña; las capturas aún pueden contener secretos visibles. Las diferencias de texto caducan de la memoria local de entrega tras dos minutos; la auditoría conserva conteos y hashes, no el texto de la conversación. Las transcripciones de proveedores tienen retención independiente. La observación por accesibilidad nativa y computer_read en macOS/Windows no requieren la ventana en primer plano. En macOS, la captura visual pasiva usa el ID de la ventana seleccionada sin activarla. La captura por región de pantalla en otros backends aún requiere primer plano para no capturar otra app que cubra la ventana. Este cambio no elimina las protecciones de foco de entrada/publicación ni garantiza acceso al contenido que la app no exponga. Las respuestas de texto autorizadas usan controles nativos dirigidos al proceso en adaptadores compatibles de macOS/Windows, sin ratón ni teclado global. Ventana, destinatario, borrador, autorización y envío único siguen siendo obligatorios. La entrada global y los diálogos nativos de archivos aún requieren primer plano. Un fallo de validación antes de cualquier entrada nativa mantiene el lote recuperable; un envío incierto nunca se repite automáticamente. Apps nativas, navegadores externos y Portales administrados requieren controles y autorización propios; probar uno no certifica los demás ni futuros cambios de interfaz. En macOS, las lecturas de la ventana seleccionada usan API nativas públicas sin llamadas repetidas a System Events. El proceso con canales privados termina tras 30 segundos inactivo y se recicla entre solicitudes confirmadas después de 256 operaciones o cinco minutos; cerrarlo cancela comandos pendientes sin repetirlos. Otra aplicación puede seguir siendo observada durante una operación dirigida a un proceso. Las lecturas del mismo proceso y la entrada global siguen siendo exclusivas. Una observación rápida o Automático habilitado no demuestran soporte de escritura o Enviar en segundo plano; una entrada no compatible no autoriza un cambio automático de foco. En macOS, abre Computadora > Respuestas de conversación y activa Foco temporal para enviar para el contacto exacto. Está desactivado por defecto y solo el usuario puede cambiarlo. computer_reply y computer_send pueden traer la ventana autorizada al frente durante la composición y el envío protegidos. La escritura, los clics recientes o modificadores pulsados aplazan la entrada. Se restauran la aplicación y la ventana anteriores, salvo que el usuario haya cambiado el foco; no se adivinan destinos cerrados o reemplazados. Un fallo de restauración se audita sin repetir el mensaje. La observación continúa en segundo plano. Esta autorización cubre el envío de texto, no los diálogos de archivos ni el control irrestricto del escritorio; siguen vigentes los permisos, las aprobaciones de publicación y la recuperación de envíos inciertos.
- Usa retención temporal para comprobaciones operativas y evidencias para hitos importantes. Las imágenes temporales vencen en 15 minutos, con un límite de 32 MiB / 64 archivos por workspace. Las evidencias usan 14 días y 256 MiB por defecto, configurables en el mismo nodo, con un máximo de 1.500 archivos. Todos los workspaces registrados con Computadora comparten un límite de 2 GiB / 5.000 archivos. Las imágenes más antiguas se eliminan primero; sus enlaces dejan de estar disponibles. La limpieza se ejecuta cada cinco minutos con Core activo y antes/después de capturas retenidas, incluso con el monitoreo pausado. Con menos de 1 GiB libre, la captura se detiene antes de escribir. La limpieza no sigue enlaces simbólicos de almacenamiento ni toca imágenes creativas. Los metadatos de auditoría y copias de conversaciones de providers tienen retención independiente; estos ajustes no eliminan esos registros.
- computer_batch acepta steps: [{input: {command: 'type', targetId: '<ventana>', text: '<texto completo>'}}, {input: {command: 'screenshot', target: 'window', targetId: '<ventana>', retention: 'temporary'}}]. Usa una clave idempotente estable para el lote y taskId; hasta 12 pasos se validan antes de cualquier efecto. Revisa completed y cada paso: un fallo o gate detiene los siguientes e incluye gateId. Reintenta un gate aprobado solo después de comprobar el destino actual, con la misma clave; los pasos completados no se repiten. Un fallo posiblemente parcial exige inspección y una acción nueva deliberada. No combines composición y publicación sin verificar primero destinatario y contenido.
Agentes interactivos, bajo demanda y persistentes
Abre el menú de una terminal de agente y elige Runtime del agente. Interactivo conserva el ciclo de vida actual del Canvas. Bajo demanda despierta con un mensaje humano o una automatización duradera, reanuda la conversación exacta del provider y duerme tras el período inactivo configurado cuando no hay ejecución ni tarea asignada activa. Persistente es supervisado por el Core en segundo plano y se reinicia tras una falla del proceso o suspensión del sistema sin exigir un Canvas renderizado. Los límites por agente controlan automatizaciones simultáneas y pausan inicios automáticos cuando una cuota conocida del provider alcanza el porcentaje elegido; el usuario siempre puede despertar manualmente. Runtime, último despertar/reposo, errores, ejecuciones, tarea y sesión usan el mismo nodo persistido y el historial del Centro de Control en Canvas, Workbench y Remote. Los agentes existentes siguen en modo Interactivo hasta un cambio explícito.
Política de autonomía, aprobaciones y credenciales cifradas
Abre Automatizaciones → Seguridad para definir una autorización permanente para trabajo desatendido. Observar registra actividad sin restringir el shell actual; Preparar y Preguntar antes de cambios pausan escrituras; Autónomo con límites mantiene el shell libre y permite acciones mediadas dentro de capacidades, raíces, hosts, horarios y concurrencia aprobados. Límites de alto riesgo como push forzado, despliegue en producción, compras, publicación externa, cambios de cuenta, eliminación masiva y acceso fuera de la autorización pueden preaprobarse o exigir al responsable, un revisor designado o consenso del Council. La Parada de emergencia desactiva todas las rutinas y aborta ejecuciones activas de inmediato. La Bóveda guarda valores en el almacén cifrado del sistema operativo y entrega a los agentes solo un SecretRef vinculado a integraciones, operaciones y destinos explícitos. OAuth o el login interactivo en Portal se completa una vez por el usuario; luego el ejecutor confiable del conector recibe la credencial solo durante la acción. Cada acción mediada es evidencia semántica exacta en una auditoría exportable encadenada por hash. Los efectos del shell libre quedan marcados como inferidos, pues Orkestrai no pretende ofrecer observación a nivel de syscall.
Automatizaciones
Abre Automatizaciones desde la barra del Canvas, el explorador del Workbench o Command/Ctrl+K. El disparador puede ser manual, programado, un cambio de tarea, un mensaje confirmado de agente, commit Git, pull request de GitHub, webhook, cambio de archivo o carpeta o límite de uso de provider. Las acciones envían un prompt a un agente, crean una tarea trazable en Kanban o muestran una notificación explícita de escritorio. Las recetas de desarrollo, diseño, marketing, investigación y operaciones ofrecen puntos de partida seguros. Cada ejecución registra entrada, agente/provider de destino, snapshots de cuota, confirmación de salida, duración, intento y fallo recuperable; los reintentos son limitados y los eventos duplicados son idempotentes. Configuración → Autonomía y Core 24/7 puede mantener el Core local y el trabajo activo en la bandeja después de cerrar todas las ventanas, iniciarlo silenciosamente al entrar al sistema, mostrar su tiempo en línea y reiniciarlo sin reiniciar toda la app de escritorio. Salir de Orkestrai sigue siendo la parada explícita. Los tokens de GitHub se cifran con safeStorage de Electron y nunca entran en la base del workspace. Las Rutinas programadas anteriores siguen compatibles y aparecen aquí automáticamente. 24/7 significa que el Core activo espera eventos o programaciones futuras, no que el modelo piensa continuamente. Por ejemplo, programa una consulta de bandeja cada 15 minutos, prepara un informe y exige aprobación para enviarlo. Cada ejecución termina y el próximo disparador inicia otra. Mantén el equipo despierto, el Core activo, credenciales válidas y cuota disponible del provider; la suspensión y el apagado detienen la ejecución local. Cerrar la ventana es distinto de Salir de Orkestrai. Revisa el historial y las aprobaciones en lugar de asumir que un terminal persistente garantiza trabajo terminado.
Ejecución durable de automatizaciones
Cada disparador de automatización se guarda en la base del workspace antes de ejecutarse. El Core lo reclama con un lease renovable, guarda checkpoints e impide que dos workers hagan la misma entrega. Si Orkestrai, el equipo o un backend de cola se detiene, un lease vencido vuelve automáticamente a la cola. Los fallos transitorios usan backoff exponencial limitado; el fallo final pasa a Requiere intervención en lugar de repetirse indefinidamente. Una acción de prompt inicia o reanuda el agente destino cuando no hay un PTY abierto. El historial muestra intento actual, próximo reintento, cancelación, salida y estado de dead letter; el trabajo en cola o ejecución puede cancelarse, y los fallos finales pueden repetirse como una nueva ejecución trazable. Los workspaces suspendidos no encolan trabajo.
Centro de integraciones y cuentas cifradas
Abre Automatizaciones -> Integraciones para conectar Gmail, Slack, Telegram, WhatsApp, GitHub o un webhook HTTPS. Gmail usa el flujo OAuth oficial en el navegador del sistema con PKCE; los demás providers reciben el token revocable del bot o app directamente en la Bóveda cifrada del sistema operativo. La base del workspace guarda solamente un SecretRef y metadatos limitados de la cuenta. Elige las operaciones exactas permitidas y, cuando corresponda, canal, chat, destinatario, repositorio o endpoint predeterminado. Los agentes nunca reciben el valor resuelto: integration_list expone el manifiesto de la cuenta, mientras integration_execute resuelve el SecretRef solo dentro del conector confiable, exige una tarea activa asignada al agente, aplica la política de autonomía del workspace y registra un evento saneado e idempotente. Las acciones cubren búsqueda/lectura/borrador/envío/etiquetas y adjuntos del workspace en Gmail; canales y mensajes de Slack; mensajes, actualizaciones y documentos del workspace en Telegram; mensajes y enlaces de documentos en WhatsApp; lectura de pull requests de GitHub; y webhooks tipados. Usa un agente Persistente o Bajo demanda con una Automatización durable para clasificar la bandeja, preparar un informe o PDF en el workspace y entregarlo a horario. Cuando un servicio no tenga conector, usa un Portal administrado y completa tú mismo el login para mantener cookies y contraseñas fuera de los prompts. En Automatizaciones > Integraciones > Actividad, Aceptado por el proveedor significa que se recibió un ID de mensaje o una aceptación HTTP, no que el destinatario recibió o leyó el mensaje. Expande Comprobante del proveedor para consultar los IDs. Envío sin confirmar significa que la publicación pudo ocurrir antes de perder la respuesta; comprueba el destino antes de actuar y nunca inventes una nueva clave de reintento. La solicitud permanece bloqueada tras reiniciar. Un fallo confirmado antes del envío permite reintentar la misma solicitud y clave después de corregir la autorización o configuración. Los registros antiguos sin resumen de solicitud no se repiten automáticamente. Una clave no puede reutilizarse con otro texto, destinatario, archivo u operación. El envío nativo de Computer tiene su propia confirmación y recuperación.
Navegador visible y publicación automática de herramientas
Inicia sesión privada o pide al agente usar una cuenta autorizada para ese sitio. Los campos de contraseña writeOnly aceptan portal_type en HTTPS o servidor local con formularios del mismo origen. El agente envía el login y verifica la página autenticada en el mismo Portal. Las contraseñas siguen ocultas; OTP, CAPTCHA, campos privados y controles explícitos conservan su autorización. Las credenciales enviadas al chat pueden quedar en el historial del proveedor: usa cuentas de prueba o acceso manual para credenciales privadas. Los Portales nuevos y sin configuración previa permiten Leer e interactuar a todo el equipo del workspace, incluidos los nuevos reclutas. En el engranaje elige Todos los agentes del workspace o Solo agentes seleccionados. Se conservan las listas explícitas existentes, Solo manual y Solo lectura. El agente controla la misma página y pestañas nativas visibles en Canvas o Workbench; cambiar de vista no crea otra sesión. El control visible es el predeterminado. Habilita explícitamente el segundo plano para trabajar con el Portal oculto; Pausar detiene inmediatamente las nuevas acciones mediadas. El uso normal del Portal no requiere activar Automatizaciones > Seguridad ni asignar una tarea. El taskId opcional debe pertenecer al agente autenticado. Las políticas explícitamente activadas siguen aplicando límites y aprobaciones; desactivadas o en modo Observar conservan el uso interactivo con auditoría. La parada de emergencia siempre se aplica. Los campos de contraseña, token, OTP y marcados como privados no aparecen en snapshots semánticos ni en el DOM y se cubren en capturas; el JavaScript arbitrario de agentes está deshabilitado. Tras cambios, toma otro snapshot en vez de reutilizar referencias antiguas. En Seguridad, habilita Herramientas creadas por agentes solo para agentes y ejecutores seleccionados en modo Delimitado. Requiere fixtures válidos, límites, permisos existentes del Portal o integración y SecretRefs vinculadas al destino. Los comandos aún requieren publicación del usuario. Las herramientas de navegador usan un id de Portal y pasos tipados ordenados con destinos semánticos exactos role/name y plantillas {{input}}. Las aprobaciones reanudan la misma ejecución desde los pasos completados, conservando revisión y clave de idempotencia; no inventes otra clave para reintentar. Un efecto interrumpido de resultado desconocido no se repite automáticamente. Auditoría expande operación, autor, destino, decisión de riesgo, salida segura y correlación, sin sobrescribir la edición de políticas al actualizar. La parada de emergencia sigue activa aunque se apague la política; prepara y guarda una reanudación explícita. Los webhooks de entrada están en Automatizaciones > Nuevo > Webhook; tras guardar, reabre el editor para ver el endpoint local completo y envía X-Orkestrai-Webhook-Secret o Bearer. Los webhooks de salida se configuran en Integraciones. El acceso desde internet requiere un túnel privado o proxy limitado a la ruta del webhook, nunca acceso público al Core completo. Los permisos del navegador son controles de la plataforma, no un sandbox del sistema operativo: un shell libre, otro navegador o un programa no mediado pueden actuar fuera de esta auditoría. El app debe seguir ejecutándose y el equipo despierto para trabajo local 24/7.
Tool Workshop: capacidades reutilizables sin exponer credenciales
Los manifiestos declaran schemaVersion, executor, inputSchema, outputSchema, capabilities, secretRefs, timeoutMs, maxOutputBytes y fixtures. Ejecutores: browser, transform, http, integration y workspace_command. Los pasos de navegador usan {action, target: {role, name}, args}; el destino debe coincidir exactamente con un elemento de un snapshot nuevo. Las plantillas resuelven entradas y pasos anteriores. Dry run valida estructura y entrada sin efectos externos; no es una prueba real del endpoint. Ejecuta fixtures controlados antes de habilitar efectos autónomos. Las revisiones guardadas son inmutables, la publicada sigue activa al proponer borradores y rollback crea otro borrador. La publicación automática exige el permiso explícito descrito arriba; los comandos siempre requieren revisión del usuario. Las SecretRefs se vinculan a tool:<slug>, integración tool y destino exacto. Reanuda ejecuciones pendientes con la misma clave de idempotencia; un efecto interrumpido de resultado desconocido exige inspección antes de otra ejecución.
Nodo Equipo y control limitado del escritorio
Pide a un agente existente, por texto, dictado o Remote: "Abre Calculadora, calcula 73 por 19 y registra el resultado verificado." El agente crea una nota y una tarea activa asignada a sí mismo, llama computer_prepare para crear/reutilizar y conectar Computadora e inspecciona el host. La preparación hereda solo una concesión Limitada activa con capacidad computer y allowedApps exactos; no amplía acceso ni reactiva nodos pausados. Sin esa concesión, autoriza la app necesaria y activa el control. En macOS concede Accesibilidad, Grabación de Pantalla y Automatización cuando se solicite. computer_launch enfoca una ventana existente, conservando su sesión, o abre la app registrada; después usa wait/inspect, entrada vinculada a la ventana y screenshot, comprueba el resultado real, actualiza la nota y completa la tarea. IDs de ejemplo: com.apple.calculator o com.google.Chrome en macOS; CalculatorApp o chrome en Windows; ID .desktop registrado o WM_CLASS correspondiente en Linux X11. Puedes autorizar un ID antes de abrir la app; las apps autorizadas cerradas siguen visibles. Entrada y captura del agente requieren una ventana permitida y una tarea activa asignada. Usa idempotencyKey estable por acción exacta; acciones en curso o con fallos posiblemente parciales no se repiten automáticamente. Inspecciona primero y usa otra clave solo para una nueva acción deliberada. La entrada es exclusiva por computadora entre workspaces, con comprobación del foco antes de escribir. Declara risk external_publication antes de enviar correo o publicar, purchase antes de comprar y el riesgo destructivo o de credenciales correspondiente; los gates activos vinculan aprobación a la solicitud e intento exactos. Operaciones por píxeles no identifican todos los riesgos ni el origen de cada sitio: no son sandbox del shell ni ocultación automática de contraseñas. Prefiere Portal o Integraciones cuando exista un contrato estructurado. SecretRefs requieren vínculo a computer.type_secret y a la app exacta; los valores viajan por stdin protegido y no vuelven al agente ni a la auditoría. Linux no admite escritura de secretos. Las capturas en .orkestrai/computer/evidence rechazan escapes por symlink, se actualizan en el nodo y son evidencia de solo lectura; contenido sensible visible puede aparecer en una captura nativa. Remote envía el pedido al agente existente del host, no a otro navegador del teléfono; el host necesita estar despierto, con Core, escritorio interactivo y permisos disponibles.
Automatización con Portal administrado
El engranaje del Portal selecciona un perfil compartido por el workspace o privado del Portal, hosts permitidos y una carpeta de descargas confinada al workspace. Inicia sesión directamente en el Portal visible: cookies y contraseñas nunca entran en prompts, mientras el Core reutiliza el perfil protegido con el Canvas cerrado. Los agentes llaman portal_snapshot para obtener referencias semánticas y usan operaciones tipadas de pestañas, navegación, clic, texto, selección, upload, download, espera, extracción y captura por nombre único o id. Los cambios de host se bloquean sin allowlist, los archivos no escapan del workspace y resultados limitados, navegaciones y mutaciones entran en Control Center con autor, Portal, referencia del perfil, resultado y correlación. Los scripts arbitrarios de agentes se rechazan; usa operaciones tipadas con permisos explícitos del Portal. El control en segundo plano requiere habilitación separada. Las automatizaciones pueden programar las mismas operaciones duraderas.
- El zoom del Canvas amplía visualmente la página sin cambiar su viewport adaptable. Redimensiona el nodo o usa Probar adaptabilidad para cambiar las dimensiones CSS reales.
- Los menús y controles del Canvas quedan sobre la página. Durante movimientos, menús abiertos o recorte del origen izquierdo/superior, la vista previa conserva la posición visual; devolver la página al área visible restaura la misma sesión interactiva sin recargar.
Instalación
Descarga la versión más reciente para macOS, Windows o Linux. La aplicación de escritorio incluye el servidor y los runtimes necesarios para operar el canvas.
- Instala al menos una CLI compatible: Claude Code, Codex, Kimi Code, OpenCode, Cursor, Antigravity, Cline, Devin o GitHub Copilot.
- En Linux, usa AppImage en cualquier distribución compatible o el paquete RPM en Fedora, RHEL, CentOS y sistemas compatibles.
- En macOS, usa la versión 0.1.4 o posterior: está firmada con Developer ID y notarizada por Apple, por lo que se abre normalmente desde Finder después de copiarla a Aplicaciones.
- Mantén Git disponible para las funciones de historial, diff y pisos.
- Los modelos locales de voz son opcionales y se descargan solo después de tu confirmación.
Primer workspace
Un workspace apunta a una carpeta real de tu proyecto. Orkestrai mantiene la configuración visual separada y provisiona el puente local que permite a los agentes operar el canvas.
- 1Crea un workspace y selecciona la carpeta del proyecto.
- 2Abre Agentes, elige cualquier servicio disponible y fija hasta cuatro favoritos si quieres acceso directo desde la barra.
- 3Marca un agente como líder para habilitar la orquestación del equipo.
- 4Describe el resultado deseado; el líder puede reclutar especialistas y distribuir tareas.
Canvas y conexiones
El canvas reúne terminales PTY reales, notas, tareas, flujos, imágenes, portales y archivos. Las conexiones representan colaboración real, muestran actividad al conversar y simplifican automáticamente la física fuera del viewport o en workspaces densos.
- Conecta notas e imágenes con sus responsables para hacer explícito el contexto.
- Asigna trabajo en el kanban; cada tarea llega directamente al terminal elegido.
- Abre Portales para ver y probar aplicaciones locales sin salir del workspace; los enlaces que solicitan una pestaña crean otro nodo Portal en el mismo Canvas.
- Usa Cmd/Ctrl+K para buscar en la documentación dentro de la aplicación.
Flujos nativos de generación de imágenes
Construye grafos creativos reutilizables directamente en el canvas. Un flujo combina su prompt con briefs conectados, hasta cinco referencias de imagen ordenadas y un ejecutor Codex activo.
- Arrastra una o varias imágenes desde Finder o el Explorador de archivos al espacio libre del Canvas para crear una referencia de Imagen por archivo, sin modificar el original. La importación admite hasta 100 imágenes de 10 MB cada una y las coloca sin superposición. Suelta archivos sobre la cabecera, el cuerpo del terminal o el prompt rápido de un agente para adjuntar referencias a los archivos del workspace a ese prompt, hasta 12 por lote. Revisa y envía el prompt manualmente; soltar no pulsa Enter ni inicia la generación. Se informan los archivos no válidos y las referencias importadas correctamente siguen visibles.
- Se requiere una cuenta o suscripción de Codex autenticada con ImageGen disponible; no se necesita una clave de API de OpenAI.
- Solicita de uno a diez resultados en un único run lógico; Codex realiza automáticamente las llamadas nativas image_gen.imagegen exigidas por su contrato.
- Elige dimensiones exactas para Instagram, Stories/Reels, TikTok o una entrega personalizada. Las áreas seguras medibles protegen el contenido importante, el máster nativo permanece intacto y una proporción incompatible vuelve a ImageGen para recomposición segura en vez de recortarse.
- Los resultados transparentes se decodifican y se verifican sus píxeles alpha reales. Con múltiples referencias, ImageGen primero compone sobre un fondo blanco uniforme y lo elimina en una segunda edición nativa; un prompt de recorte de cuadriculado ya validado ofrece otro fallback nativo. Python y la manipulación local de píxeles siguen prohibidos.
- Un Codex conectado puede crear o revisar borradores, agregar, quitar o reordenar entradas, ejecutar o cancelar la generación y eliminar el flujo mediante tools tipadas.
- Orkestrai nunca solicita ni almacena una clave de API de imagen y nunca llama directamente a un endpoint del provider.
- Cada resultado validado se escribe en su destino preasignado del workspace y vuelve como nodo Imagen conectado con historial y procedencia limitados.
- Canvas, Workbench, CLI y MCP operan el mismo flujo persistido sin un estado paralelo de automatización.
- Las terminales Codex iniciadas desde Canvas usan el MCP de la instalación actual de Orkestrai solo para esa sesión, sin reescribir la configuración del usuario.
Cliente de API nativo
Crea, importa y prueba HTTP/REST, GraphQL, WebSocket y gRPC en el mismo workspace de la implementación, sin mover el trabajo cotidiano de APIs a otra aplicación.
- Usa OAuth 2.0 asistido, Bearer, Basic o clave API con cookie jar, proxy, CA propia, certificados de cliente y controles TLS.
- Edita JSON, JavaScript, GraphQL y XML con sintaxis, búsqueda, formato y autocompletado según el runtime; explora árboles de respuesta JSON/XML y transcripciones WebSocket/gRPC.
- Sincroniza orígenes Bruno y OpenCollection vinculados con pull, push, vigilancia y resolución explícita de conflictos; Postman y OpenAPI siguen siendo pull-only.
- Importa Bruno, OpenCollection YAML, Postman v2.1, Swagger 2.0 u OpenAPI 3.x; exporta Bruno, OpenCollection, Postman u OpenAPI 3.1 JSON/YAML con notas explícitas de fidelidad.
- Importa y exporta entornos Postman por separado o respalda todo el estado nativo con el formato versionado de Orkestrai.
- Conecta el nodo a agentes y líderes para que creen o editen colecciones completas con seguridad, ejecuten requests y runners y exporten Bruno o Postman mediante tools MCP y CLI tipadas sin exponer secretos almacenados.
Workbench y editor
Workbench convierte el mismo workspace en una superficie de escritorio enfocada. El explorador abre agentes, tareas, notas, portales, dispositivos móviles y archivos en hasta ocho paneles redimensionables.
- Elige pestañas verticales u horizontales y divide cualquier panel hacia la derecha o abajo.
- Edita archivos en Monaco con modelos persistentes, búsqueda y reemplazo, símbolos, formato y protección de cambios sin guardar.
- Abre vistas de Markdown, PDF, imágenes y binarios sin crear nodos desconectados en el canvas.
- Usa Cmd/Ctrl+K para buscar archivos, contenido, agentes, tareas, herramientas, configuración y comandos.
Inteligencia de código operativa
El grafo nativo conecta código indexado, trabajo en vivo, evidencia limitada y acciones de entrega sin enviar el código fuente del repositorio a otro servicio.
- Usa el modo Asistido para actualización incremental casi en tiempo real y consultas de agentes que esperan la revisión conocida más reciente; Manual reserva la indexación explícita al usuario, mientras Desactivado detiene watchers y acceso sin borrar el historial.
- Construye un paquete de contexto trazable con un presupuesto explícito de 500 a 16.000 tokens, revisa símbolos, relaciones, tests, hallazgos y fragmentos censurados y luego envíalo al líder, a un agente disponible, a Council o a Kanban.
- Inspecciona en el grafo la responsabilidad en vivo de agentes, tareas y Pisos y detecta rutas o símbolos superpuestos antes de que colisione el trabajo paralelo.
- Selecciona una relación para saber si procede de análisis estático, inferencia o evidencia de runtime, con procedencia y confianza.
- Compara revisiones persistidas de código y relaciones y guarda investigaciones con nombre que restauran repositorio, modo, filtros, símbolo, ubicación en el código y cámara del grafo.
- La selección del grafo y Monaco permanecen sincronizados, mientras CLI y MCP exponen los mismos contratos de contexto, operaciones, explicación, revisión, comparación e investigación.
Design Studio nativo y entrega de código
Los documentos de diseño permanecen editables en Orkestrai mientras personas y agentes usan el mismo scene graph estructurado. El área Código conecta el trabajo visual con el proyecto real sin crear una exportación desconectada.
- Importa estructuras HTML/Tailwind, Svelte, React/JSX o Vue como capas nativas editables sin ejecutar scripts del proyecto.
- Genera Svelar/Svelte 5, React, Next.js, Vue 3 o HTML/Tailwind solo después de revisar el archivo completo.
- Reutiliza mappings compatibles de Code Connect y abre cada artefacto vinculado directamente en Monaco.
- Compara un frame seleccionado con un Portal en vivo o dispositivo móvil conectado mediante vistas normalizadas de referencia, implementación, overlay y pixel diff.
- Convierte la evidencia visual en una tarea de Kanban o entrada del Centro de Revisión vinculada al cambio Git real.
Prototipos interactivos y motion nativos
Flujos de prototipo, interacciones, presentación y animación permanecen dentro del mismo documento Diseño nativo que usan la edición manual, la interoperabilidad con Figma, los agentes y la entrega.
- Crea varios flujos iniciales y usa disparadores de clic, presión, hover o tiempo para navegación, overlays, volver, desplazamiento y modos de variables.
- Previsualiza transiciones, hotspots, capas fijas, overflow horizontal o vertical, marco de dispositivo y pantalla completa en el player enfocado.
- Comparte un prototipo HTML autocontenido y de solo lectura sin exponer el workspace.
- Crea tokens reutilizables de duración y easing, tracks por capa y keyframes; después copia animaciones CSS o código Motion.dev.
- Usa el mismo command bus protegido por revisión desde el editor, búsqueda universal, CLI Orkestrai o agentes MCP tipados.
Colaboración en vivo en Diseño
Personas y agentes conectados revisan el mismo documento Diseño versionado con presencia visible y decisiones explícitas, sin intercambiar capturas desconectadas.
- Ve cursores, selecciones, páginas y modo seguir durante una revisión conjunta.
- Ancla conversaciones versionadas, respuestas, menciones y resolución a una página o capa.
- Previsualiza propuestas de agentes y revisa su diff estructural antes de que una aprobación humana explícita las aplique de forma atómica.
- Usa leases cortos de capa para bloquear escrituras en conflicto sin trabar todo el documento.
- Lleva trabajo incierto a Council o un Piso aislado y concede a dispositivos Remote permisos independientes de Ver, Comentar, Proponer o Editar sobre resúmenes sanitizados.
Calidad, templates y recuperación de Diseño
El documento nativo mantiene verificaciones de producción y controles de recuperación junto a las mismas capas que editan personas y agentes.
- Audita nombres genéricos o duplicados, texto y contenido recortados, superposición inesperada, contraste WCAG y metadatos de accesibilidad ausentes.
- Selecciona cualquier problema para saltar directamente a la capa afectada.
- Comienza trabajos de producto, marketing, mobile o design system con templates nativos completos, editables y con variables y semántica.
- Recupera un documento dañado desde el backup automático, consulta el historial reciente de revisiones y compacta explícitamente el historial limitado.
- Los documentos grandes renderizan incrementalmente alrededor del viewport sin ocultar contenido de la búsqueda, agentes, exportación o auditoría.
Líder y puente Orkestrai
El líder coordina el equipo mediante la CLI orkestrai y las tools MCP provisionadas en el workspace. Puede conversar con agentes, escribir notas, crear tareas, abrir portales y organizar pisos.
orkestrai list
orkestrai ask Frontend "Implementa la pantalla según la nota de especificación"
orkestrai task add "Revisar responsividad" --assign Reviewer
orkestrai notify "Entrega lista para revisión"Flujos y trabajo paralelo
Los flujos encadenan agentes, aprobaciones humanas y salidas reutilizables. Los pisos usan git worktrees para aislar frentes paralelos y mostrar diffs y conflictos antes de aterrizar en la rama principal.
- Sincroniza un flujo con sus conexiones para convertir el dibujo en pipeline.
- Consulta título, etapa y responsable de cada tarea en planta baja y cada worktree.
- Crea un piso por feature cuando varios equipos modifiquen el mismo proyecto en paralelo.
- Revisa la vista previa antes de aterrizar; los conflictos nunca se resuelven silenciosamente.
Dictado y respuestas habladas
El dictado usa Parakeet y las respuestas usan Supertonic 3, ambos localmente. Hay presets para portugués de Brasil, inglés de Estados Unidos y español latinoamericano. Mientras el micrófono se abre o transcribe, pulsa Cancelar para detener el intento. Las respuestas tardías no pueden abrir el micrófono ni insertar texto después. La apertura tiene un límite de 15 segundos y la transcripción de tres minutos; la grabación se detiene y transcribe automáticamente a los 15 minutos. Cancelar descarta ese intento sin enviar texto al agente.
- Enfoca un campo de tarea, rol, nota o formulario y usa la esfera global para insertar el dictado en el cursor.
- Opcionalmente, envía el dictado de la terminal con Enter; los campos de texto comunes permanecen solo para inserción.
- Sin un campo activo en el canvas, la esfera envía la transcripción al líder.
- Elige y prueba el micrófono y el altavoz y ajusta la voz y velocidad entre 0,75x y 1,50x en Configuración.
- Los dispositivos retirados vuelven al predeterminado, con orientación distinta para permiso, hardware ausente, captura interrumpida o probable contención de la entrada.
- La primera descarga requiere confirmación; después, el procesamiento ocurre en el dispositivo.
Operación y continuidad
Los workspaces siguen trabajando en segundo plano. Las sesiones reanudables preservan cada conversación y las notificaciones distinguen tarea completada, proyecto completado y atención.
- Cambia el provider de un agente conservando su rol, piso y conexiones.
- Fija Uso en el canvas y deja que el líder consulte origen, fallback, ventana monitoreada y límite antes de asignar trabajo nuevo.
- Puertos lista únicamente listeners vinculados a Portales locales del workspace actual.
- Elige un tema claro u oscuro listo, o edita y comparte tokens semánticos validados.
- Los datos del canvas, las sesiones y los modelos locales permanecen en tu equipo.
Decisiones, automatización, dispositivos y colaboración
El Centro de Control y el Centro de Revisión hacen explícitas la actividad y las evidencias. Council, Automatizaciones, Dispositivo móvil y el uso compartido cifrado siguen el mismo modelo operativo trazable.
- Solicita perspectivas independientes a entre dos y cinco agentes en Council y conserva la selección final humana.
- Ejecuta automatizaciones idempotentes por agenda, tareas, mensajes, eventos Git, webhooks, archivos o límites de uso.
- Controla iOS Simulator y emuladores Android o dispositivos físicos aprobados desde Canvas y Workbench.
- Elige una invitación para navegador/móvil o app instalada, aprueba el dispositivo y rol exactos y sigue la proyección sanitizada en la PWA Remote instalable.
- Remote mantiene cada área accesible en móvil y muestra el enfoque actual, la actividad semántica reciente y los totales de coordinación de cada agente sin exponer mensajes internos.
- Los Operadores pueden conversar con un agente de forma trazable. Los Administradores pueden iniciarlo o restaurarlo; el terminal sin filtrar exige un permiso separado por dispositivo, desactivado por defecto y auditado.
Coordinación, atención y contexto duradero
Orkestrai convierte las señales de entrega en un historial operativo conectado en lugar de dispersarlas entre la salida de terminal, tarjetas y notificaciones transitorias.
- Los recibos duraderos de mensajes y la actividad semántica conservan quién envió qué, su estado de entrega, resultado, fuente y correlación entre reinicios.
- El Centro de Atención y la Búsqueda Universal muestran preguntas, permisos, fallos, mensajes y actividad pendientes en todos los workspaces con filtros estructurados.
- Workstreams conecta una tarea Kanban con su agente, Piso, branch, Council, revisión Git, evidencia, pruebas, riesgos y archivos vinculados sin duplicar registros.
- La Memoria del workspace guarda decisiones, restricciones, hechos, preferencias, referencias y aprendizajes con fuentes, revisiones inmutables y protección de conflictos.
- El Centro de Anotaciones unifica comentarios de revisión de código y Diseño sobre sus revisiones canónicas y señala el feedback desactualizado.
- Los Team Packs versionados conservan roles, skills, notas y estructura reutilizables con notas de versión, verificación de integridad y sin estado de runtime.
- Los Huddles persistentes permiten dirigirse a agentes seleccionados, dictar turnos, recuperar la transcripción, crear una tarea vinculada y continuar con seguridad desde la PWA Remote.
Scripts y pruebas del Cliente de API
Referencia práctica de Postman Runtime oficial, del runtime QuickJS seguro oficial de Bruno y de las pruebas declarativas nativas de Orkestrai.
- La ejecución incluye scripts pre-request de colección, carpetas y solicitud, la llamada de red, scripts post-response de solicitud, carpetas y colección y, por último, assertions nativas.
- Postman mantiene separados pm.globals, pm.collectionVariables, pm.environment, pm.iterationData y pm.variables. Bruno expone los equivalentes de entorno, global, colección, runtime, secrets e iteración del runner.
- Postman admite sendRequest, runRequest, flujo de colección, cookies, vault, visualizer, APIs legadas, pm.require para bibliotecas incluidas, metadatos de iteración correctos y Chai incluido. Bruno admite sendRequest, runRequest, req/res, variables de solicitud y carpeta, variables post-response, assertions declarativas, bloques tests, cookies, flujo del runner, visualizaciones, bibliotecas incluidas y test/expect/assert globales.
- El JavaScript importado se ejecuta sin cambios en el runtime de origen seleccionado. Package Library de equipo, datasets alojados, mocks y estados en la nube aún requieren los servicios Postman porque no forman parte del archivo portable de la colección. Bruno permanece en el runtime QuickJS seguro oficial, con el acceso NodeVM inseguro al filesystem, procesos y módulos locales arbitrarios deliberadamente deshabilitado.
Scripts compatibles con Postman
Selecciona el runtime Postman y pega los bloques en los editores correspondientes. Los ámbitos permanecen separados y cada fila del runner alimenta pm.iterationData.
const requestId = 'req-' + Date.now();
const tenant = pm.iterationData.get('tenant');
pm.variables.set('requestId', requestId);
pm.globals.set('lastTenant', tenant);
pm.request.headers.upsert({
key: 'X-Request-Id',
value: requestId,
});
pm.vault.get('apiKey').then((apiKey) => {
pm.request.headers.upsert({ key: 'X-API-Key', value: apiKey });
});
console.log('Solicitud preparada:', requestId, tenant);let body;
pm.test('El status es 200', () => {
pm.expect(pm.response.code).to.equal(200);
});
pm.test('El body es JSON válido', () => {
body = pm.response.json();
});
if (body) {
pm.test('La respuesta contiene access_token', () => {
pm.expect(body).to.have.property('access_token');
});
pm.test('La respuesta contiene el id del usuario', () => {
pm.expect(body).to.have.property('user');
pm.expect(body.user).to.have.property('id');
});
if (body.access_token) {
pm.environment.set('accessToken', body.access_token);
}
if (body.user?.id) {
pm.environment.set('userId', body.user.id);
}
pm.execution.setNextRequest('Cargar usuario');
console.log('Usuario autenticado:', body.user?.id);
}GET {{baseUrl}}/users/{{userId}} HTTP/1.1
Authorization: Bearer {{accessToken}}
X-Request-Id: {{requestId}}Scripts compatibles con Bruno
Selecciona el runtime Bruno. Las APIs oficiales bru, req, res, test, expect y assert se ejecutan en el runtime QuickJS seguro.
const login = await bru.runRequest('Auth / Login');
const token = login.data.access_token || bru.getVar('accessToken');
if (!token) {
throw new Error('Falta la variable accessToken');
}
req.setHeader('Authorization', 'Bearer ' + token);
req.setHeader('Accept', 'application/json');
console.log('Solicitud autenticada');const body = res.getBody();
test('El usuario fue creado', () => {
expect(res.getStatus()).to.equal(201);
expect(body).to.have.property('id');
});
bru.setVar('createdUserId', body.id);
bru.setVar('lastStatus', res.getStatus());
bru.setNextRequest('Cargar usuario');
console.log('Usuario creado:', body.id);Orkestrai nativo: pruebas sin JavaScript
Configura assertions en la pestaña Pruebas. No existe orkestrai.expect; los scripts usan pm.test/pm.expect o el alias global expect, mientras el flujo nativo usa filas declarativas.
Fuente Ruta Operador Esperado
Status — Igual 200
Body data.user.id Existe —
Header content-type Contiene application/json
Tiempo respuesta — Menor que 1000Variable de colección: baseUrl = https://api.example.com
Variable de entorno: accessToken = <token del entorno activo>
Variable creada por script: userId = 42
URL: {{baseUrl}}/users/{{userId}}
Header: Authorization = Bearer {{accessToken}}Agentes 24/7 con autonomía limitada y Tool Workshop
Mantén workspaces seleccionados activos en segundo plano con agendas duraderas, agentes headless reanudables, navegador administrado, control del equipo, conectores seguros y herramientas reutilizables del workspace.
- Usa políticas permanentes del workspace para operaciones rutinarias sin pedir aprobación en cada comando; los gates explícitos siguen protegiendo límites destructivos, financieros, de credenciales o fuera de política.
- Conecta Gmail, Slack, Telegram, WhatsApp y webhooks genéricos mediante adapters de provider. Los agentes pueden reunir datos, crear informes o PDF en el workspace y entregarlos mediante una acción aprobada.
- Las credenciales viven en el almacenamiento cifrado del sistema operativo. Agentes y automatizaciones reciben SecretRefs opacas; solo el ejecutor confiable resuelve el valor transitoriamente después de validar la herramienta, acción y destino exactos.
- Los Portales administrados conservan perfiles aislados y sesiones autenticadas para sitios sin una API adecuada. Las operaciones de navegador y computadora están limitadas, son idempotentes cuando es posible y quedan representadas en la auditoría.
- Tool Workshop convierte llamadas HTTP revisadas, acciones de conectores, transformaciones declarativas y comandos exactos del workspace en revisiones publicadas inmutables. Los agentes proponen borradores; solo el propietario publica, archiva o revierte.
- Canvas, Workbench, Automatizaciones, actividad Remote, CLI y MCP usan los mismos runs persistidos, ids de revisión, decisiones de política, entradas ocultadas, digests de salida y evidencias.