GeekZilla
GeralInstagramTecnologia

Microsoft lança OmniParser V2, que permite que qualquer LLM vire um agente interativo

A Microsoft lançou recentemente o OmniParser V2, uma ferramenta inovadora que transforma qualquer Modelo de Linguagem de Grande Escala (LLM) em um agente capaz de interagir diretamente com interfaces de computador. Esta versão aprimorada do OmniParser visa superar as limitações anteriores, oferecendo uma compreensão mais profunda e precisa das interfaces de usuário (UIs) por meio de captura de tela.

O OmniParser V2 funciona convertendo capturas de tela de UIs em elementos estruturados e compreensíveis. Isso permite que modelos como o GPT-4V não apenas interpretem o conteúdo visual, mas também executem ações específicas dentro da interface. Para alcançar essa funcionalidade, a Microsoft treinou modelos especializados em detecção de ícones interativos e geração de descrições funcionais desses elementos. Esses modelos foram refinados utilizando um conjunto de dados abrangente, que inclui 67 mil imagens de capturas de tela, cada uma anotada com caixas delimitadoras destacando regiões interativas.

Uma das melhorias significativas na versão V2 é a redução de 60% na latência, obtida através da diminuição do tamanho das imagens no modelo de legendas de ícones. Além disso, o OmniParser V2 alcançou uma precisão média de 39,6% no benchmark ScreenSpot Pro, que avalia a capacidade de identificação precisa de ícones em telas de alta resolução.

Para facilitar a experimentação e a integração com diferentes LLMs, a Microsoft desenvolveu o OmniTool, um sistema Windows em contêiner que incorpora um conjunto de ferramentas essenciais para agentes baseados em IA. O OmniParser V2 é compatível com diversos modelos de ponta, incluindo OpenAI (4o/o1/o3-mini), DeepSeek (R1), Qwen (2.5VL) e Anthropic (Sonnet), combinando etapas de compreensão de tela, associação contextual, planejamento de ações e execução.

Em termos de responsabilidade e ética, a Microsoft treinou o modelo de legendas de ícones com dados que seguem práticas de IA responsável, minimizando a inferência de atributos sensíveis, como raça ou religião, presentes em imagens de ícones. Além disso, recomenda-se que os usuários apliquem o OmniParser apenas em capturas de tela que não contenham conteúdo prejudicial.

O OmniParser V2 representa um avanço significativo na interação entre modelos de linguagem e interfaces gráficas, ampliando as capacidades dos LLMs para além da compreensão textual e permitindo uma interação mais intuitiva e eficaz com sistemas computacionais.