에이전트가 ai-decoration을 부른 1,325건과 좌패널에서 부른 4,926건을
같은 판정 기준으로 놓고, 겹치는 2주는 사람·다운로드까지 창고에서 맞췄어요.
두 곳은 같은 엔진을 쓰는데 자리가 다르니 성적도 다를 거라 봤는데, 갈리는 건 부르는 자리가 아니라
요구를 열어 두었는지였어요.
어디서 부르는지는 결과를 바꾸지 않아요. 같은 2주를 같은 방법으로 재면 요청 다음 날까지 가는 비율 — 그날 그 디자인이 다운로드된 비율 — 이 에이전트 59.4%, 좌패널 59.5%로 같아요. 결과물 판정으로 봐도 흠 없이 눈에 띄게 잘된 결과가 좌패널 버튼 21.4% 대 에이전트 정형 23.9%(우연일 가능성 28%), 좌패널 프롬프트 16.9% 대 에이전트 자유 발화 14.9%(20%)로 붙어 있어요.
갈리는 축은 요구를 열어 두었느냐 하나예요 — 같은 표면 안에서 요구를 열면 양쪽 다 내려가요(좌패널 21.4% → 16.9%, 에이전트 23.9% → 14.9%). 다만 그 차이도 판정까지만이고 다운로드까지는 안 가요(정형 62.1% vs 자유 63.3%). 그래서 지금 고를 수 있는 건 «어느 자리에서 부를까»가 아니라 무엇을 요구로 받을까와 무엇으로 성적을 잴까예요.
에이전트의 정형 제안이 그 모양이에요. 좌패널 버튼과 견주면 흠이 잡히지 않은 결과가 22.8%에서 31.2%로 올라가요(우연일 가능성 0.04%). 차이는 맥락 문장 하나예요 — 좌패널 버튼은 «교체 또는 추가»가 그대로 들어가는데 에이전트는 캔버스 내용을 요약한 88자를 보내요. 그러니 좌패널에도 이식할 수 있는 변경이에요. 단 이 이득은 판정까지만 확인됐어요 — 다운로드는 62.1% 대 63.3%로 같아요.
자유 발화 200건을 손으로 갈라 보면 요소를 얹거나 바꾸는 것으로 풀리는 요구는 45%뿐이에요. 41%는 색·글자·배경·크기·사진 보정처럼 이 도구가 못 하는 일이고, 14%는 «다른거»·«별로 바뀐게 없넹?»처럼 지시가 아니라 대화 턴이에요. 받아 줄 도구는 이미 있어요 — 요소 생성·사진 생성·글자 편집·배경 제거가 같은 2주에 따로 돌고 있는데, 꾸미기 다음에 그쪽으로 넘어가는 건 4.3%뿐이에요.
좌패널 브리프의 다음 스텝은 입력률을 21.9%에서 80%로 올리는 것이었는데, 그 실험을 에이전트 자유 발화 982건이 이미 대신 돌렸어요. 요구를 열면 못 하는 요구가 39% 따라 들어오고 판정 평균이 2.50에서 2.14로 내려가요. 입력창을 여는 값은 «못 하는 것을 입력 중에 거르는 장치»와 같이 올 때만 생겨요 — 브리프의 시뮬레이션과 같은 결론이에요.
두 자리를 같은 자로 잴 수 있는 지표가 지금은 «같은 날 다운로드» 하나인데,
그건 꾸미기와 거의 무관하게 59%가 나오는 값이라 아무것도 가르지 못해요.
좌패널에서 실제로 갈렸던 지표는 요소 생존(9.2%)이고, 에이전트는
agent_tool_call.items가 비어 있어 배치한 요소 키가 남지 않아요.
이 한 칸을 찍는 것이 다음 할 일이에요.
그런데 에이전트의 적용률 44%를 «더 잘된다»로 읽으면 안 돼요. 에이전트에서는 판정 점수와 적용이 아무 관계가 없어요(승산비 0.98, 우연일 가능성 69%). 좌패널은 관계가 뚜렷하고요(1.19, 0.01% 미만). 더 이상한 건 «전·후가 그대로»인 결과의 적용률이 59.4%로 가장 높다는 거예요(나머지 41.7%, 0.01%).
그래서 두 표면의 적용률은 같은 뜻의 숫자가 아니에요. 좌패널의 채택은 결과를 보고 고른 것에 가깝고 에이전트의 적용은 «일단 올려서 보자»에 가까워요. 판단은 흠 없이 눈에 띄게 잘된 결과의 비율로 했어요. 자세한 건 «적용»의 뜻 탭에 있어요.
요구를 열지 않은 두 자리는 21.4%와 23.9%(우연일 가능성 28%), 요구를 연 두 자리는 16.9%와 14.9%(20%)로 각각 붙어 있어요. 네 묶음을 가로로 읽으면 아무 일도 안 일어나고, 세로로 읽어야 숫자가 움직여요.
배치 자체의 흠(가림·톤·산만·안 보임)을 합하면 에이전트 정형 59.5%, 자유 55.1%로 거의 같아요. 엔진은 어디서 불러도 같은 성적을 내요. 갈리는 칸은 «요청과 다름» 하나이고, 그건 요구가 도구 범위 밖일 때 붙는 사유예요.
정형 호출은 교체가 6.7%인데 자유 발화는 29.6%예요. 좌패널도 똑같아요 — 버튼만은 4.0%, 프롬프트는 26.6%. «~로 바꿔줘»라고 말하면 교체 경로로 가는데, 좌패널 진단에서 글자를 바꿔 낀 77건은 결과물에 남은 것이 0%였어요. 교체를 늘리는 것 자체가 목표가 되면 안 되는 이유예요.
1,325건 중 310건이 «내용에 맞는 요소로 꾸며줘», 33건이 «지금 요소들 다 3D 스타일로 바꿔줘»예요. 제안 칩으로 보이고, 이 묶음이 네 자리 중 판정 성적이 가장 좋아요. 늘릴 자리가 이미 제품 안에 있다는 뜻이에요.
에이전트 꾸미기 1,709명, 좌패널 꾸미기 2,002명인데 겹침이 38명이에요. 요금제 구성도 달라서(무료 0.3% 대 11.3%) 표면끼리의 수치 차이는 집단 차이와 섞여 있어요. 같은 표면 안에서 요구 축으로 가른 비교만 이 오염에서 자유로워요 — 그래서 결론을 그 축으로만 세웠어요. 누가 쓰나 탭 참고.
가로가 표면(좌패널·에이전트), 세로가 요구(열지 않음·열음)예요. 가로로는 안 갈리고 세로로 갈려요.
큰 숫자는 «흠 없이 눈에 띄게 잘된 결과»의 비율이에요 — 판정이 흠을 못 찾았고 전·후 차이가 뚜렷하다고 본 것.
| 묶음 | 건수 | 흠 없이 눈에 띔 | 흠 없음 | 요청과 다름 | 가림 | 안 보임 | 교체 비중 | 판정 평균 | 채택·적용 |
|---|---|---|---|---|---|---|---|---|---|
| 좌패널 · 버튼만 | 3,846 | 21.4% | 22.8% | 2.9% | 34.0% | 5.0% | 4.0% | 2.50 | 32.5% |
| 좌패널 · 프롬프트 | 1,080 | 16.9% | 17.8% | 19.6% | 26.5% | 2.2% | 26.6% | 2.25 | 34.0% |
| 에이전트 · 정형 발화 | 343 | 23.9% | 31.2% | 9.3% | 17.2% | 31.5% | 6.7% | 2.60 | 47.3% |
| 에이전트 · 자유 발화 | 982 | 14.9% | 17.1% | 27.8% | 14.8% | 20.8% | 29.6% | 2.14 | 43.0% |
«채택·적용»은 두 표면에서 뜻이 달라요 — 좌패널은 결과를 본 뒤의 채택, 에이전트는 적용·취소가 기록된 1,053건 기준의 적용이에요. 분모도 다르고 행동도 달라서 이 칸끼리는 견주지 않았어요.
| 비교 | 값 | 우연일 가능성 | 읽기 |
|---|---|---|---|
| 정형끼리 — 좌패널 버튼 vs 에이전트 정형 | 21.4 → 23.9% | 28% | 차이 없음 |
| 자유끼리 — 좌패널 프롬프트 vs 에이전트 자유 | 16.9 → 14.9% | 20% | 차이 없음 |
| 좌패널 안 — 버튼 vs 프롬프트 | 21.4 → 16.9% | 0.13% | 요구를 열면 내려감 |
| 에이전트 안 — 정형 vs 자유 | 23.9 → 14.9% | 0.01% | 요구를 열면 내려감 |
| «흠 없음»만 — 정형끼리 | 22.8 → 31.2% | 0.04% | 맥락 주입의 몫 |
| «흠 없음»만 — 자유끼리 | 17.8 → 17.1% | 69% | 차이 없음 |
«흠 없이 눈에 띄게 잘된 결과»에서는 맥락 주입의 이득(21.4 → 23.9%)이 유의하지 않아요. 맥락은 흠을 줄이지만 그만큼 조심스러운 배치가 돼서 «티가 안 남»이 31.5%로 늘거든요. 그 둘을 합치면 남는 순이득이 작아져요.
여기서부터는 판정 이미지가 아니라 창고 데이터예요. 두 자리가 겹치는 2주(2026-09-15~29)를 잘라 사람 단위로 맞췄어요.
두 자리는 사실상 다른 사람들이 써요. 같은 2주에 둘 다 쓴 사람은 38명뿐이에요. 에이전트를 어떤 툴이라도 쓴 사람 6,418명으로 넓혀도 좌패널 꾸미기와 겹치는 건 78명(1.2%)이에요.
요금제 구성도 달라요 — 에이전트 쪽은 PRO 68.9% · PRO 체험 29.8% · 무료 0.3%인데 좌패널은 PRO 56.7% · 체험 31.8% · 무료 11.3%예요. 에이전트 숫자가 좋아 보이면 유료 사용자 집단이라는 것을 먼저 빼고 봐야 해요. 이 문서가 표면 간 차이를 결론으로 쓰지 않는 이유 중 하나예요.
| 무엇 | 에이전트 | 좌패널 | 읽기 |
|---|---|---|---|
| 2주간 1인당 호출 | 1.80회 | 1.97회 | 거의 같아요 |
| 한 번만 쓰고 만 사람 | 63.9% | 62.2% | 양쪽 다 3분의 2가 일회성 |
| 5회 이상 쓴 사람 | 5.1% | 6.6% | 헤비 유저 비중도 비슷 |
| 같은 날 그 디자인이 다운로드됨 | 59.4% | 59.5% | 같은 방법으로 쟀어요 — 차이 없음 |
| 배치한 요소가 결과물에 남음 | 측정 불가 | 9.2% | 에이전트는 요소 키를 안 남겨요 |
에이전트 안에서 꾸미기 호출 다음에 오는 행동을 세어 봤어요. 절반 이상이 거기서 끝나고, 네 번에 한 번꼴로 꾸미기를 다시 불러요. 다른 도구로 갈아타는 흐름은 거의 없어요.
이게 제안 2를 떠받치는 숫자예요. 꾸미기가 못 하는 요구를 받았을 때 에이전트에는 이미 받아 줄 다른 도구가 있어요 — 같은 2주에 요소 생성 4,097건, 요소 검색 2,733건, 사진 생성 2,138건, 글자 편집 387건, 배경 제거 1,432건이 돌았어요. 그런데 꾸미기 다음에 그쪽으로 넘어가는 비율은 4.3%뿐이고, 꾸미기를 쓴 사람 중 요소 생성도 써 본 사람은 20.2%예요. 빗나간 요구가 다른 도구로 흘러가지 않고 꾸미기 재호출(27.7%)로 돌아와요.
에이전트 자유 발화 200건을 무작위로 뽑아 손으로 갈랐어요. 기준은 «요소를 새로 얹거나 있던 요소를 다른 요소로 바꾸는 것으로 풀리는가»예요.
에이전트가 요구를 거르지는 않아요. 좌패널 입력창에 직접 쓴 요구의 39.5%가 범위 밖인데, 에이전트 자유 발화도 같은 낱말 규칙으로 재면 38.7%예요. 사람이 말하는 내용은 입력창이든 채팅이든 같고, 에이전트는 그걸 다듬어서 그대로 넘겨요.
넘기면서 말을 붙이기도 해요. 발화에는 없던 «배경»·«글자»·«사진» 같은 말이 툴 요청문에서 새로 생긴 경우가 자유 발화의 20.7%예요. 요구가 범위 밖으로 확장되는 쪽이지 좁혀지는 쪽이 아니에요.
| 요구를 열었을 때 따라오는 것 | 좌패널 | 에이전트 |
|---|---|---|
| «요청과 다름» 판정 | 2.9% → 19.6% | 9.3% → 27.8% |
| 교체 경로 비중 | 4.0% → 26.6% | 6.7% → 29.6% |
| 판정 평균(5점) | 2.50 → 2.25 | 2.60 → 2.14 |
| 흠 없이 눈에 띄게 잘됨 | 21.4% → 16.9% | 23.9% → 14.9% |
네 줄이 전부 같은 방향이에요. 표면과 무관하게 «요구를 받는다»는 선택 자체가 내리는 값이에요. 그렇다고 요구를 받지 말자는 뜻은 아니고, 받으려면 받기 전에 걸러야 한다는 뜻이에요 — 좌패널 브리프에서 «못 하는 것을 미리 말해요» 레버가 채택률에는 마이너스인데 결과물까지 남는 비율에는 +7.2%p로 가장 컸던 것과 같은 이야기예요.
에이전트의 적용률이 더 높게 보이지만, 그 숫자는 품질을 따라가지 않아요. 성과 지표로 쓰면 안 되는 이유를 셋으로 나눠 놨어요.
좌패널은 판정이 1점 오를 때 채택 승산이 1.19배가 돼요(우연일 가능성 0.01% 미만). 에이전트는 0.98배이고 우연일 가능성이 69%예요. 두 기울기가 다르다는 것 자체는 0.23%로 분명해요. 에이전트에서 적용을 지표로 쓰면, 좋아진 것과 나빠진 것이 같은 값으로 들어와요.
나머지는 41.7%인데 «변화 없음» 138건만 59.4%예요(우연일 가능성 0.01%). 좌패널에서는 같은 대비가 41.5% 대 32.7%로 유의하지 않았어요. 에이전트에서는 결과를 확인하려고 일단 올려 보는 클릭이 적용에 섞여 있다고 읽는 게 자연스러워요.
1,325건 중 272건은 사용자가 무엇을 했는지 기록이 없어요. 좌패널은 결과 확인율이 89.6%로 잡혀요.
더 큰 구멍은 그다음인데, 에이전트는 GA action_decoration을 찍지 않아서
올린 요소가 결과물까지 남았는지를 잴 방법이 없어요. 좌패널 진단의 대표 지표가 바로 그거예요.
그래서 에이전트에 붙일 첫 작업은 기능 개선이 아니라 계측이에요. 좌패널과 같은 세 칸 — 결과를 봤는가, 적용했는가, 요소가 다운로드까지 남았는가 — 을 찍기 전에는 두 자리의 성적을 같은 자로 비교할 수 없어요. 지금 비교가 판정 이미지에만 기대고 있는 이유이기도 해요.
이 비교에는 결론을 좁히는 조건이 넷 있어요. 특히 첫 번째는 표에 있는 숫자 하나를 직접 무효로 만들어요.
«가림»은 두 표면을 견줄 수 없어요. 좌패널은 800px 실제 스크린샷으로 판정했고, 에이전트는 320px 합성 이미지로 판정했어요. 에이전트 안에서 이미지 픽셀 수로 넷을 갈라 보면 가림 검출이 9.1% → 10.6% → 18.1% → 23.8%로 올라가요. 작게 보면 덜 찾는다는 뜻이에요.
그래서 «에이전트가 덜 가린다»(34.0% vs 17.2%)는 읽기는 쓰면 안 돼요. 같은 이유로 «안 보임»이 에이전트에서 크게 나오는 것도 얼마쯤은 해상도 몫이에요. 이 비교를 확정하려면 좌패널 표본을 같은 해상도·같은 합성 방식으로 다시 판정해야 해요.
에이전트 꾸미기는 결과 이미지를 서버에 남기지 않아서, 반환된 배치 좌표로 실제 캔버스 위에 다시 그린 그림으로 판정했어요. 위치와 크기는 실제와 같지만 레이어 순서와 투명도는 다를 수 있어요.
좌패널은 2026-07-29~08-30, 에이전트는 09-15~20이에요. 그사이 엔진이 바뀌었다면 그 몫이 표면 차이로 잘못 잡힐 수 있어요. 다만 이 문서의 결론은 표면 간 차이가 아니라 표면 안의 요구 축 차이라서, 기간 차이에 덜 흔들려요.
무료 요금제가 에이전트 꾸미기 사용자의 0.3%, 좌패널의 11.3%예요.
표면 간 수치를 견줄 때 이 구성 차이를 보정하지 않았어요 — 그래서 이 문서는
표면 간 차이를 결론으로 쓰지 않고, 같은 표면 안의 요구 축 차이만 결론으로 썼어요.
사람 단위 숫자는 agent_trace.account_id와 decoration_request_mart.uid를
맞춰 낸 것이고, 창은 둘 다 2026-09-15~29예요.
| 무엇 | 건수 | 출처 |
|---|---|---|
| 에이전트 꾸미기 호출 | 1,325 | agent-decoration-cases 케이스 브라우저 · 2026-09-15~20 전수 |
| 좌패널 꾸미기 요청(판정본) | 4,926 | ai-decoration-brief 케이스 브라우저 · 2026-07-29~08-30 |
| 좌패널 직접 프롬프트 | 1,080 | 같은 표본 중 입력창에 요구를 쓴 것(21.9%) |
| 손으로 가른 자유 발화 | 200 | 982건에서 무작위 추출 · 분류 기준은 «무엇을 요구받았나» 탭 |
| 에이전트 꾸미기 호출(창고) | 3,293 | gold.agent.agent_tool_call × agent_trace · 2026-09-15~29 |
| 좌패널 꾸미기 요청(창고) | 3,946 | gold.agent.decoration_request_mart · 같은 창 · emp=유저 |
| 다운로드 대조 | — | silver.miricanvas_searching.design_download_resource · design_idx × 같은 날 |
좌패널 쪽 전체 모수는 요청 9,449건·결과 확인 8,314건이고,
이 문서가 쓴 4,926건은 그중 전·후 이미지가 남아 판정이 붙은 부분이에요.
판정은 두 표본 모두 databricks-claude-sonnet-5가 전·후 2장을 보고 매겼고, 채택 여부는 가린 채로 물었어요.