qoder可否内置屏幕截图及标注功能,并结构化传入大模型,提升多模态意图识别准确率

背景与痛点

Qoder 当前支持传入图片,但用户在使用第三方截图标注软件时,存在以下问题:

  • 标注信息丢失:第三方工具的标注(箭头、高亮框、备注文字)仅作为像素嵌入图片,大模型无法区分“原始 UI”与“用户标注”,导致识别准确性下降。
  • Token 浪费与幻觉:模型需额外消耗 Token 解析视觉标注,且常将标注误认为 UI 元素本身,产生错误代码或误导性回答。
  • 交互割裂:用户需在外部工具标注后手动粘贴到 Qoder,打断编码心流。

期望方案

在 Qoder 内集成轻量级截图标注工具,并将标注内容以结构化数据形式与图片一同传入大模型:

  1. 内置截图标注能力
    • 支持基础标注:矩形框、箭头、序号标记、文字备注、模糊/遮挡敏感信息。
    • 快捷键唤起,无需离开 IDE 窗口。
  2. 结构化标注传输协议
    • 标注不渲染进图片像素,而是作为独立的结构化字段(如 JSON)附加在 Prompt 中。

    • 示例格式:

      json
      

      {
      "image": "base64_or_ref",
      "annotations": [
      {"type": "bbox", "coords": [x,y,w,h], "label": "登录按钮样式异常"},
      {"type": "arrow", "from": [x1,y1], "to": [x2,y2], "note": "此处间距应为16px"},
      {"type": "text", "position": [x,y], "content": "新增搜索框"}
      ]
      }

  3. 模型端适配
    • System Prompt 中增加对结构化标注的解析指令,引导模型优先依据标注语义理解用户意图,而非仅依赖视觉识别。

预期收益

  • 准确性提升:消除视觉标注歧义,UI 还原/Bug 定位场景的预期准确率显著提升。
  • 效率提升:减少用户二次文字解释的成本,缩短单次交互轮次。
  • 差异化竞争力:相比仅支持纯图片上传的竞品,形成“意图级多模态交互”的体验壁垒。