Paper page - Text-Vision Co-Instructed Image Editing
…We then propose TV-Edit , a Textual-Visual instruction unified Editing framework to contextualize drag or point-based visual instructions with image-text semantics and lift them into semantic-aware control representations…