전체 글
-
FROM EXPLORATION TO MASTERY: ENABLING LLMSTO MASTER TOOLS VIA SELF-DRIVEN INTERACTIONS논문 2026. 8. 25. 22:11
도구 학습은 대규모 언어 모델이 외부 도구를 호출하여 외부 환경과 상호작용할 수 있도록 하는 방법으로, 사전학습 데이터가 가진 한계를 보완하는 효과적인 전략입니다. 이 과정에서 도구 문서는 LLM에게 도구 사용 방법을 알려주는 핵심적인 역할을 하며, 모델이 도구를 효과적으로 활용할 수 있도록 돕습니다.본 논문은 기존의 인간 중심 도구 문서에 존재하는 불충분하거나 부정확한 정보로 인해 발생하는 LLM과 외부 도구 사이의 이해 격차를 해결하는 문제에 초점을 맞춥니다.이를 위해 저자들은 DRAFT라는 새로운 프레임워크를 제안합니다. DRAFT는 LLM이 외부 도구와 실제로 상호작용하는 과정에서 얻은 피드백과 시행 결과를 분석하여 도구 문서를 동적으로 개선하는 방법입니다.DRAFT의 핵심은 시행착오 기반 학습 ..
-
FrontCoder: Scaling Visual Fidelity in Front-End Code Generation논문 2026. 8. 24. 15:53
LLM은 자연어 명령으로부터 기능적으로 동작하는 코드(functional code)를 생성하는 데 놀라운 발전을 이루어 왔습니다.그러나 사용자가 의도한 레이아웃과 인터페이스를 충실하게 렌더링할 수 있도록 시각적으로 정확하고(visual accuracy), 구조적으로도 견고한(structurally sound) 프런트엔드 코드를 생성하는 것은 여전히 중요한 과제로 남아 있습니다. 기존 연구의 대부분은 주로 기능적 정확성(functional correctness)에 초점을 맞추고 있으며, 프런트엔드 개발에서 필수적인 시각적 충실도(visual fidelity)와 렌더링 품질(rendering quality)은 상대적으로 간과해 왔습니다. 이러한 한계를 해결하기 위해, 본 연구에서는 코드 LLM의 프런트엔드 ..
-
ReLook: Vision-Grounded RL with a Multimodal LLM Critic for AgenticWeb Coding논문 2026. 8. 24. 13:27
LLM은 알고리즘 중심의 코드 생성에서는 뛰어난 성능을 보이지만, 결과의 정확성을 렌더링된 픽셀과 사용자 인터랙션을 기준으로 판단해야 하는 프런트엔드 개발에서는 여전히 어려움을 겪습니다. ReLook은 에이전트가 멀티모달 LLM을 도구로 호출함으로써, 견고한 생성–진단–개선 루프를 완성할 수 있도록 하는 에이전트 기반, 비전 그라운딩 강화학습 프레임워크입니다. 학습 과정에서 에이전트는 MLLM을 루프 안에 포함시켜 두 가지 역할로 활용합니다.첫째, 스크린샷을 기반으로 생성된 코드를 평가하는 시각적 비평가(visual critic) 역할을 수행합니다.둘째, 실제 화면에 근거한 실행 가능한 비전 그라운딩 피드백을 제공합니다. 또한 정상적으로 렌더링되지 않는 결과에는 보상을 전혀 주지 않는 엄격한 제로 보상 ..
-
EASYTOOL: Enhancing LLM-based Agents with Concise Tool Instruction논문 2026. 8. 19. 11:44
LLM을 기반으로 하는 자율 에이전트가 복잡한 현실 세계의 문제를 해결하기 위해 도구(tool)를 활용하는 것에 대한 관심이 증가하고 있다.LLM 기반 에이전트를 개발하려면 일반적으로 LLM이 서로 다른 도구 문서에 기술된 수많은 도구 기능을 이해해야 한다. 그러나 이러한 문서들은 형식이 제각각이거나, 불필요하게 중복되어 있거나, 필요한 정보가 누락되어 있을 수 있으며, 이는 LLM의 도구 활용 능력에 상당한 영향을 미친다.이 문제를 해결하기 위해 우리는 다양하고 방대한 도구 문서를 통일되고 간결한 도구 지침(tool instruction)으로 변환하여 도구를 보다 쉽게 사용할 수 있도록 하는 프레임워크인 EASYTOOL을 제안한다.EASYTOOL은 서로 다른 출처의 방대한 도구 문서에서 도구 사용에 필..
-
Tool Documentation Enables Zero-ShotTool-Usage with Large Language Models논문 2026. 8. 19. 10:17
LLM은 새로운 도구의 사용법을 보여주는 몇 개의 데모를 제공받음으로써 새로운 도구를 사용하는 방법을 학습한다.하지만 데모는 확보하기 어렵고, 잘못된 데모가 선택될 경우 바람직하지 않은 편향된 도구 사용으로 이어질 수 있다.데모를 쉽게 확보할 수 있는 드문 상황에서도, 몇 개의 데모를 제공해야 하는지, 그리고 어떤 데모를 선택해야 하는지를 결정하기 위한 원칙적인 선택 프로토콜은 존재하지 않는다. 본 연구에서는 데모에 대한 대안으로 도구 문서(tool documentation)를 제안한다. 우리는 데모 대신, 개별 도구의 사용법을 설명하는 도구 문서를 사용할 것을 주장한다.우리는 비전과 언어 모달리티에 걸친 6개의 과제에 대한 세 가지 주요 실증적 결과를 통해 이러한 주장을 뒷받침한다. 첫째, 기존 벤..
-
SkillsBench - Benchmarking How Well Agent SkillsWork Across Diverse TasksEval 2026. 8. 2. 07:54
Agent Skills은 LLM 에이전트가 특정 작업을 더 잘 수행할 수 있도록, 추론 과정에서 업무 절차와 전문 지식을 제공하는 구조화된 패키지입니다.모델을 다시 학습시키지 않고도 업무 절차, 도메인 규칙, 코드 템플릿, 참고 자료, 실행 스크립트 등을 추가할 수 있습니다.최근 Agent Skills는 코딩 에이전트와 범용 에이전트를 중심으로 빠르게 확산되고 있습니다. 하지만 한 가지 중요한 질문은 여전히 남아 있습니다.Skills를 추가하면 에이전트의 성능은 실제로 얼마나 좋아질까? 그동안은 이를 체계적으로 확인할 수 있는 평가 기준이 거의 없었습니다. 이 질문에 답하기 위해 만들어진 벤치마크가 SKILLSBENCH입니다.SKILLSBENCH는 8개 분야의 87개 과제로 구성됩니다. 각 과제에는 해당..
-
왜 코딩 하니스가 모든 지식노동의 백본이 되는가Agent 2026. 7. 27. 02:04
Box CEO Aaron Levie가 본 에이전트 확산의 다음 단계앞선 글에서는 Deep Agent가 데이터베이스를 탐색하고 Query와 Widget을 생성한 뒤, 저장된 코드를 LLM 없이 반복 실행하도록 구현했습니다.[이전 글: 2026.07.26 - [Agent] - 답변을 코드로 바꾸는 에이전트 구현을 마친 뒤 한 가지 질문이 남았습니다.왜 하필 코딩 에이전트여야 할까? 데이터 분석이 필요하다면 데이터 분석 에이전트를, 마케팅 업무라면 마케팅 에이전트를 따로 만드는 것이 더 자연스러워 보입니다.그런데 최근 범용 에이전트는 반대 방향으로 발전하고 있습니다.먼저 코드를 작성하고 실행할 수 있는 하니스를 만듭니다. 그 위에 데이터베이스, 파일시스템, 브라우저, 문서 작성, 외부 SaaS 도구를 연결합니..
-
답변을 코드로 바꾸는 에이전트Agent 2026. 7. 26. 23:34
Deep Agent와 데이터베이스로 검증해 본 대화형 위젯 생성의 가능성AI에게 질문하면 답을 줍니다. 하지만 그 답이 반복해서 사용할 수 있는 업무 도구로 남는 것은 아닙니다.“지난달 가입자 수는 몇 명이야?”“국가별 분포는 어때?”“최근 30일 기준으로 다시 보여줘.” 업무 질문은 한 번의 답변으로 끝나지 않습니다. 결과를 확인하면서 조건을 바꾸고, 같은 분석을 다시 실행하거나 다른 사람과 공유해야 합니다.이런 업무를 처리할 때는 보통 필요한 내용을 그때그때 대화형 AI에게 질문하거나, 자주 확인하는 지표를 대시보드로 만들어 사용합니다.두 방식은 각각 데이터 탐색과 반복 실행에서 서로 다른 강점을 가집니다. 대화형 AI대시보드질문 변경대화를 이어가며 자유롭게 조건을 바꿀 수 있다새로운 조건이나 지표가..