背景与痛点
Qoder 当前支持传入图片,但用户在使用第三方截图标注软件时,存在以下问题:
- 标注信息丢失:第三方工具的标注(箭头、高亮框、备注文字)仅作为像素嵌入图片,大模型无法区分“原始 UI”与“用户标注”,导致识别准确性下降。
- Token 浪费与幻觉:模型需额外消耗 Token 解析视觉标注,且常将标注误认为 UI 元素本身,产生错误代码或误导性回答。
- 交互割裂:用户需在外部工具标注后手动粘贴到 Qoder,打断编码心流。
期望方案
在 Qoder 内集成轻量级截图标注工具,并将标注内容以结构化数据形式与图片一同传入大模型:
- 内置截图标注能力
- 支持基础标注:矩形框、箭头、序号标记、文字备注、模糊/遮挡敏感信息。
- 快捷键唤起,无需离开 IDE 窗口。
- 结构化标注传输协议
-
标注不渲染进图片像素,而是作为独立的结构化字段(如 JSON)附加在 Prompt 中。
-
示例格式:
json{
"image": "base64_or_ref",
"annotations": [
{"type": "bbox", "coords": [x,y,w,h], "label": "登录按钮样式异常"},
{"type": "arrow", "from": [x1,y1], "to": [x2,y2], "note": "此处间距应为16px"},
{"type": "text", "position": [x,y], "content": "新增搜索框"}
]
}
-
- 模型端适配
- System Prompt 中增加对结构化标注的解析指令,引导模型优先依据标注语义理解用户意图,而非仅依赖视觉识别。
预期收益
- 准确性提升:消除视觉标注歧义,UI 还原/Bug 定位场景的预期准确率显著提升。
- 效率提升:减少用户二次文字解释的成本,缩短单次交互轮次。
- 差异化竞争力:相比仅支持纯图片上传的竞品,形成“意图级多模态交互”的体验壁垒。