VLM 更适合做什么
视觉语言模型擅长连接开放词汇与视觉语义,适合用于任务理解、场景描述、候选目标生成,以及为下游模块提供更丰富的先验。
它暂时不应该独自承担高频、强实时或安全关键的控制决策。更稳妥的方式,是让模型参与分层系统中的语义层。
一个实用的系统边界
- VLM 负责理解用户意图和生成候选目标。
- 几何模块验证目标是否真实存在、是否可达。
- 规划器在安全约束内生成动作。
- 监控模块持续检查执行偏差。
评估不要只看准确率
除了任务成功率,还应跟踪响应延迟、无效输出率、需要人工确认的比例,以及不同环境变化下的退化曲线。
保持模块化
模型能力变化很快,系统接口应该允许替换模型,而不必重写数据流、评估和安全策略。模块化不是为了架构漂亮,而是为了让实验结果能够更快进入真实系统。