你好,我在测试本项目sam2的过程中,发现得到的mask结果和原SAM2的推理结果不一致: 在小目标时,mask经常偏大且超出prompt框,并且在传播几帧后容易分割到背景上导致跟踪失败。 另外,注意到代码中[parms.prompt_box = min_dis_rect;](https://github.com/Aimol-l/OrtInference/blob/5cf4fea91064e782fc9b21ac6b07d3ee29369889/src/SAM2.cpp#L576)使用上一帧的结果框box作为下一帧的prompt,这一点和原SAM2设计是否不一致? 我的测试视频为[B站飞鸟](https://www.bilibili.com/video/BV14a4y1q7aS/?spm_id_from=333.337.search-card.all.click&vd_source=477eaa05f2cba981fe6250dbef368292),box为【1226, 666, 18, 20】 效果图对比: sam2:<img width="281" alt="000" src="https://github.com/user-attachments/assets/aabf51d6-95e4-4055-b7b7-7bc9a7c61abb" style="zoom:50%;"> OrtInference:<img width="176" alt="111" src="https://github.com/user-attachments/assets/5d82051c-68fe-4519-8f3a-96cdc6d2cec1">
你好,我在测试本项目sam2的过程中,发现得到的mask结果和原SAM2的推理结果不一致:
在小目标时,mask经常偏大且超出prompt框,并且在传播几帧后容易分割到背景上导致跟踪失败。
另外,注意到代码中parms.prompt_box = min_dis_rect;使用上一帧的结果框box作为下一帧的prompt,这一点和原SAM2设计是否不一致?
我的测试视频为B站飞鸟,box为【1226, 666, 18, 20】

效果图对比:
sam2:
OrtInference: