Cognition, la compañía detrás de Devin, presentó durante septiembre de 2026 dos novedades dirigidas al desarrollo de software con inteligencia artificial: SWE-2, un nuevo modelo especializado en tareas de programación, y Fusion, un sistema diseñado para combinar modelos de IA con diferentes funciones dentro de un mismo flujo de trabajo.

Las dos tecnologías parten de una misma idea: no basta con que un modelo de inteligencia artificial sea capaz de programar; también es importante que pueda completar las tareas utilizando de manera eficiente el tiempo y los recursos de cómputo.

SWE-2 busca mejorar la relación entre capacidad y costo

Cognition presentó SWE-2 el 10 de septiembre de 2026 como su modelo de programación más avanzado hasta ese momento. La compañía señala que fue desarrollado mediante entrenamiento de refuerzo y construido a partir de Kimi K3, un modelo de 2,8 billones de parámetros que ya había sido entrenado para tareas de programación mediante agentes.

Uno de los principales cambios está en la manera de entrenar el modelo. Cognition incorporó penalizaciones relacionadas directamente con el costo de las ejecuciones, buscando que el sistema no solamente encuentre una solución correcta, sino que también evite realizar pasos innecesarios durante el proceso.

Según las pruebas publicadas por Cognition, SWE-2 obtuvo 50,0 % en FrontierCode 1.1 Main, frente al 50,9 % registrado por Fable 5.1. La empresa afirma que SWE-2 alcanza ese resultado con un costo 64 % menor en ese benchmark.

Sin embargo, estos resultados deben interpretarse teniendo en cuenta que se trata de benchmarks y que buena parte de las cifras de comparación son publicadas por los propios desarrolladores de los modelos.

Menos pasos para completar las tareas

Una de las diferencias que Cognition destaca frente a su modelo anterior, SWE-1.7, es la reducción de los pasos necesarios para resolver determinadas tareas.

En FrontierCode 1.1 Main, Cognition reportó que SWE-1.7 necesitaba en promedio 127 pasos, mientras que SWE-2 en su nivel medio de esfuerzo necesitaba 53. Además, el nuevo modelo registró un costo promedio 81 % menor y utilizó 58 % menos turnos en esas pruebas.

La compañía también señala que SWE-2 comienza a modificar el código más rápidamente. En sus pruebas internas, el primer cambio significativo apareció después de una mediana de 18 pasos, frente a 48 pasos para SWE-1.7.

Esto refleja un cambio de comportamiento: en lugar de explorar grandes cantidades del código antes de comenzar, SWE-2 intenta identificar con mayor rapidez qué partes del proyecto son relevantes para la tarea.

No todos los resultados favorecen a SWE-2

Los resultados publicados por Cognition muestran que el comportamiento del modelo depende del benchmark utilizado.

En DeepSWE 1.1, SWE-2 obtuvo 73,0 %, mientras que en Terminal-Bench 2.1 consiguió 92,8 %. Sin embargo, en Terminal-Bench 4 alcanzó 27,3 %, por debajo de varios de los modelos comparados en esa prueba.

Por esta razón, los resultados no significan que SWE-2 sea superior en todas las tareas de programación. Su principal propuesta está relacionada con conseguir un equilibrio entre capacidad, cantidad de trabajo realizado y costo.

¿Qué es Devin Fusion?

Un día después de presentar SWE-2, Cognition anunció Fusion, una arquitectura para trabajar con dos modelos de inteligencia artificial durante una misma sesión de desarrollo.

En lugar de utilizar un único modelo para todo, Fusion divide las responsabilidades entre un modelo principal o «lead», encargado de planificar, interpretar las instrucciones y revisar los resultados, y un modelo secundario o «sidekick», que ejecuta tareas como explorar el código, realizar modificaciones y ejecutar pruebas.

La idea es utilizar un modelo más avanzado cuando se necesita razonamiento y supervisión, mientras que un modelo más económico realiza buena parte del trabajo operativo.

Así funciona el sistema

El modelo principal mantiene el control de la sesión y puede delegar una tarea concreta al modelo secundario. Este recibe un resumen con las instrucciones, restricciones y criterios que debe cumplir.

Después de trabajar sobre el código, el modelo secundario devuelve los resultados al modelo principal, que puede revisarlos, detectar problemas y decidir si es necesario realizar modificaciones adicionales.

Cognition señala que esta arquitectura evita tener que transferir toda la conversación entre los dos modelos. Cada agente mantiene su propio contexto y solamente intercambia información relevante, como instrucciones, resultados y comentarios.

Fusion puede reducir el costo de las ejecuciones

Las pruebas publicadas por Cognition junto con Artificial Analysis y Vals AI muestran reducciones de costo al utilizar Fusion en diferentes benchmarks.

Por ejemplo, con Fable 5.1 como modelo principal y SWE-2 como modelo secundario, Cognition reportó un costo 46 % menor en DeepSWE 1.1, 23 % menor en Terminal-Bench 4 y 38 % menor en FrontierCode 1.1 Extended frente al uso de Fable 5.1 solo en esas pruebas.

Con GPT-6 Astra y SWE-2, las pruebas reportaron reducciones de entre 11 % y 40 %, dependiendo del benchmark.

En Devin CLI, Cognition presenta actualmente Fusion como una combinación en la que un modelo avanzado toma las decisiones mientras SWE-2 puede encargarse de parte del trabajo de implementación. La compañía afirma que, en el Artificial Analysis Coding Agent Index 1.5, la combinación Fable 5.1 + SWE-2 tuvo un costo de 7,90 dólares por ejecución frente a 12,36 dólares para Fable 5.1 con Claude Code en la comparación mostrada por Cognition.

¿Qué cambia para los desarrolladores?

La llegada de SWE-2 y Fusion refleja un cambio en la evolución de los agentes de programación. El objetivo ya no es únicamente generar código a partir de una instrucción, sino resolver tareas completas de ingeniería de software, incluyendo exploración de proyectos, implementación, pruebas, depuración y revisión.

SWE-2 aborda principalmente el modelo que realiza el trabajo, mientras que Fusion modifica la manera en que distintos modelos pueden colaborar dentro de una misma sesión.

Esto también puede cambiar la forma de medir el costo de estas herramientas. Cognition sostiene que el precio por token no siempre representa el costo real de una tarea, porque un modelo más barato puede necesitar más intentos, más pasos o más correcciones para llegar al mismo resultado.

Disponibilidad

SWE-2 comenzó a estar disponible en Devin Desktop y Devin CLI el 10 de septiembre de 2026, mientras que Cognition anunció su incorporación progresiva a Devin Web y Fusion.

Fusion fue presentado el 11 de septiembre de 2026 para Devin Desktop y CLI. Cognition también ha indicado que continúa trabajando en nuevas arquitecturas multiagente y en mejoras del sistema.

Una apuesta por hacer más eficiente la programación con IA

Con SWE-2 y Fusion, Cognition está intentando abordar uno de los principales desafíos de los agentes de programación: cómo aumentar su capacidad sin que cada tarea implique un costo elevado.

SWE-2 busca conseguirlo mediante un modelo entrenado para considerar tanto el éxito de una tarea como el costo de los pasos utilizados para resolverla. Fusion, por su parte, divide el trabajo entre un modelo encargado del razonamiento y la supervisión y otro dedicado a la ejecución.

Los resultados publicados hasta ahora muestran reducciones de costo en diferentes pruebas, aunque el desempeño varía según el benchmark y el tipo de tarea. Por ello, el impacto de estas herramientas dependerá también de cómo se comporten en proyectos reales y en distintos flujos de desarrollo de software.