- ニュース
ネイティブ統合マルチモーダルがさらに進化!SenseNova U1.5-Lite-Previewをオープンソース化、生成・編集能力をさらに強化
今年4月、SenseTimeはSenseNova U1を発表し、Neo-unifyアーキテクチャに基づくネイティブ統合マルチモーダルのアプローチを初めて全面的に示しました。単一モデル内で言語、視覚セマンティクス、ピクセル生成を統合的にモデリングすることで、モデルは視覚理解、推論、生成をネイティブに実行できます。
過去数カ月にわたり、私たちはモデルの画像生成・編集能力を継続的に強化してきました。このたび、軽量な統合マルチモーダルモデルのプレビュー版SenseNova U1.5-Lite-Previewをコミュニティ向けにオープンソース化します。SenseNova U1.5-Lite-Previewは単なるモデル規模の拡大ではなく、U1を基盤とした体系的な進化です。同一アーキテクチャ上で視覚理解、推論、生成、編集を一貫して実現するだけでなく、わずか8B-MoTという軽量な規模で能力を4K、高精細なリアルな質感、より複雑なビジュアル制御、継続的な反復編集へと引き上げています。

SenseNova U1.5-Lite-Previewによる生成
U1と比較して、U1.5-Lite-Previewは次の各方面で大幅に向上しています。
- ネイティブに対応4K画像生成;
- より精緻な局所テクスチャ、ディテールとリアルな質感;
- より正確な中国語・英語のテキスト生成と複雑なレイアウト構成;
- より安定した画像編集とビジュアル指示への忠実な追従;
U1が「統合アーキテクチャは実現可能か」という問いを検証し、ピクセルと言語を起点としてエンドツーエンドでネイティブ統合マルチモーダルモデルを構築することが実現可能な道筋であると証明したとすれば、U1.5はさらに「能力を継続的に拡張できるか」を検証します。統合アーキテクチャは理解と生成を同時に担えるだけでなく、より高解像度、より複雑な情報表現、よりリアルな視覚世界へと拡張できることを証明します。
私たちは、未来のマルチモーダルモデルは異なるモダリティをつなぐシステムにとどまらず、最初から言語、視覚、行動を横断して学習し、思考し、創造できる統合知能エージェントであるべきだと考えています。
長いコンテキストによるビジュアル制御:モデル能力と創作支援の協調
U1.5-Lite-Previewでは生成能力を体系的に磨き上げました。私たちが追求したのは単なる4Kの高画素化ではありません。モデルが超長文の自然言語や構造化されたビジュアル指示を理解し、正確なビジュアル制御を実現できるか。超大画面でもディテールを拡大に耐えられる状態に保ち、十分にリアルな質感を維持できるか。情報量の多いコンテンツでも、テキストとレイアウトを十分に安定させられるか。こうした点を重視しています。
より高いビジュアル制御の上限:詳しく書くほど、生成画像は正確に
ポスター、インフォグラフィック、ブランドビジュアルなど、より複雑な創作タスクでは、1枚の画像に複数の要件を同時に満たすことが求められます。画面内にどのような主体があるか、人物と物体がどのように関わるか、各要素をどこに配置するか、どのようなビジュアルスタイルを採用するか、どのテキストを表示するか、そしてどの内容を必ず維持し、何を避けるべきか、といった要件です。
U1.5-Lite-Previewは、長文の自然言語や構造化された創作指示の理解能力を重点的に最適化しています。簡単な要望であれば、ユーザーは数文の平易な言葉で素早く生成できます。複雑なタスクであれば、詳細かつ完全な創作要件を提示することで、モデルに明確なビジュアル構造に沿って実行させることができます。私たちの考えでは、超長文のプロンプトは良い画像を生成するための必須条件ではありません。その価値は、複雑な創作に対してより高い制御の上限を提供することにあります。
以下の「バックパック製品分解図」インフォグラフィックでは、1675語の超長文プロンプトを使用し、レトロな博物学標本図鑑風のスタイル、5章構成、中国語・英語の対訳、ラテン語表記など、複雑な制約を盛り込んでいます。

重要な点として、U1.5-Lite-Previewの強力なプロンプト・フォローイング能力は、主に構造化テンプレートの記憶や適応に由来するものではありません。専用のPrompt Enhance形式データに大きく依存したトレーニングを行わない場合でも、モデルは長文、多制約、階層化されたビジュアル指示を比較的安定して実行できます。私たちは、これこそがネイティブ統合マルチモーダルのアプローチの強みだと考えています。モデルが学習したのは特定のPrompt形式そのものではなく、言語による記述からビジュアル構造へのネイティブなマッピング能力です。
複雑なビジュアル指示の作成に伴うハードルを下げるため、私たちは実験的なPrompt Enhance Skill:も提供しています。これはユーザーの簡単なアイデアを、主体、レイアウト、スタイル、テキスト、各種制約を含む完全な創作プランへ自動的に整理し、それをモデルに実行させるものです。ユーザーが要望をより漏れなく表現できるよう支援し、説明不足による結果のずれを減らします。
ネイティブ4K生成:超大画面でも、ディテールは拡大に耐える
4Kは単にピクセル数が多いというだけでなく、ディテール、素材感、光と影、全体の一貫性に対するより高い要求を意味します。自然風景、商業写真、製品ポスター、超ワイドな長巻物、高精細なビジュアルコンテンツのいずれであっても、U1.5-Lite-Previewはリアルな素材感と光影の階調を表現できます。
以下のケースでは、モデルが2018年から2026年にわたるWAICの発展の歩みを描いた長巻物を生成しました。

WAICの発展の歩み(解像度4K、アスペクト比10:3、promptの総文字数3880 words)
この長巻物は、中国の伝統的な山水長巻に見られる散点透視と連続的な叙事手法を用い、上海の都市、スマート交通、クラウドコンピューティング、スマート工場、大規模モデル、生成AI、具身ロボット、エージェント、未来都市を一つの山河の中に融合しています。拡大して見ても、大量のテキストやアイコンなどのデザインディテールが、なお鮮明かつ安定して保たれています。
超大画面に加え、U1.5-Lite-Previewは一般的な画像のリアリティとディテール表現でも明らかな向上を実現しています。

海岸ビジターセンターの建築コンセプト画像

ロマンチックな暮らしをテーマにしたコラージュポスター

日差しの下の顔のクローズアップ

レトロな手帳ページ

テーマ性のあるクリエイティブポスター。人物写真と誇張されたフォントを融合したデザイン

船上で漁網を整理する漁師

ミニチュアの料理人チームがブルーベリークリームをデコレーションしている様子

夏のコールドブリューコーヒーのファッション広告ポスター

道端に立つ女性。その背後を車が行き交っている
テキスト生成とレイアウトの進化:情報量が多くても、安定した仕上がり
U1.5-Lite-Previewは、中国語・英語のテキスト生成と複雑なレイアウト構成の能力を強化しています。雑誌の見開き、旅行ガイド、複雑なインフォグラフィックに至るまで、ビジュアルスタイルを維持しながら、より明確なレイアウト構造とより正確なテキスト表現を構成できます。

雑誌の見開き

インフォグラフィック

武康路 Citywalk ガイド
編集能力の進化:一度きりの試行錯誤から脱却し、気になる箇所を思いどおりに修正
画像編集は単純な局所ピクセルの再描画ではありません。モデルが画像の内容を理解し、ユーザーの真の意図をくみ取り、「どこを、どのように変更し、どの部分には絶対に手を加えてはいけないか」を正確に判断する必要があります。
ネイティブ統合マルチモーダルアーキテクチャにより、U1.5-Lite-Previewは複数の独立したモデルをつなぎ合わせる必要がありません。単一モデル内で、視覚理解、対象の特定、制約の推論、ピクセル生成に至る全プロセスを連携して実行します。同時に、encoder-freeのビジュアルモデリング方式を採用し、固定ビジュアルエンコーダーによる情報圧縮と表現のボトルネックを低減しています。文字のストローク、局所テクスチャ、空間構造などの精緻な情報をより完全に保持することで、編集の正確性、画像の安定性、制御性をさらに向上させています。
U1.5-Lite-Previewにより、画像編集は付加的な機能ではなく、視覚状態を理解し、ユーザーの制約を実行し、対象画像を再構成する、統合モデルのネイティブな能力となっています。これにより、画像創作は一度きりの「再サンプリング」から、継続的に反復できるビジュアル操作プロセスへと変わります。モデルは現在の生成結果を基に、コピーの継続的な修正、レイアウトの調整、要素の追加を行えます。「一度試して、うまくいかなければやり直す」から、「何度も修正し、納得いくまで仕上げる」へと変わるのです。
現在、U1.5-Lite-Previewはさまざまな主流のクリエイティブワークフローをカバーしています。
参照画像のスタイルとデザインの再創作:スタイルを理解し、あらゆるテーマへ応用
参考画像の配色、構図、質感、フォント、ビジュアル言語を理解して、新しいコンテンツテーマに反映できます。また、元の情報を維持したまま、ポスターやインフォグラフィック全体のビジュアルを洗練させ、デザインをアップグレードすることも可能です。

入力画像

出力画像
事例:青花磁器風の古建築の屋根図鑑
複数の参考画像を組み合わせて編集:画像をまたいで要素を抽出し、新たな作品に融合
複数の参考画像から人物、製品、シーン、スタイルをそれぞれ抽出し、画像をまたいだ要素の結合、コンテンツの融合、シーンの再構成を行えます。
水煮魚のメニューとフライドチキンを融合し、新しい料理メニューを作成する例↓
入力画像:


出力画像:

単一の参考画像による制作:1枚の画像を基に、完全なビジュアルデザインを実現
人物、製品、シーンの画像1枚をビジュアル条件として、主体のアイデンティティ、外観、重要なディテールを維持しながら、新しいポスター、インフォグラフィック、マーケティングページなどのデザインコンテンツを生成できます。

入力画像

出力画像
事例:人物写真を使った履歴書レイアウト
インフォグラフィックの部分編集:一部を変えても、全体はそのまま
インフォグラフィック内のタイトル、数字、アイコン、注釈、グラフ、コンテンツモジュールを対象に、狙いを定めた編集が可能です。要素の追加・削除、位置調整、部分的なビジュアルの洗練、欠陥の修復にも対応します。

入力画像

出力画像
事例:タイトル文字の置き換え
文字編集:文字を変えても、スタイルはそのまま
実際のシーンに含まれる文字を編集しながら、元のフォント、質感、パース、レイアウト、遮蔽関係を維持し、文字を元の画像に自然に溶け込ませることができます。

入力画像

出力画像
事例:手描き注釈の追加
インタラクティブな高精度編集:枠で囲んで、モデルに「ここを変更」と指示
領域のマーキング、座標指定、markerによるマーキングなどに対応し、モデルが編集位置と範囲をより正確に理解できるようにします。部分的な属性の調整も可能です。

入力画像

出力画像
事例:赤枠で指定した領域を編集
U1を基盤とした体系的なイテレーション:アーキテクチャの実現可能性の検証から、実際のシーンで使いやすいモデルへ
U1は、ネイティブな統合マルチモーダルアーキテクチャの実現可能性を検証しました。一方、実際の導入やコミュニティからのフィードバックを通じて、この技術路線には依然として改善の余地がある、現実のシーンにおける課題も明らかになりました。
生成シーンでは、U1は異なる領域間のつながりが不自然になることがあり、わずかなグリッド感、継ぎ目、テクスチャの断裂が生じる場合があります。また、生成解像度がさらに高くなると、局所的なディテール、複雑な空間関係、画像全体の一貫性をモデル化する難度も一段と高まります。
画像編集タスクでは、U1は自然言語による編集指示を理解できますが、より複雑な実際のワークフローでは、編集範囲外のコンテンツが変化したり、人物のアイデンティティや主体の構造が変化したり、部分的な変更が画像全体に影響したりする問題が依然として発生する可能性があります。
U1.5-Lite-Previewは、こうした実際の制作における課題を的確に解決することを目指し、モデル規模をむやみに拡大することなく、生成から編集までの全工程を体系的に最適化しました。
グリッド状のアーティファクトや高解像度のディテールモデリングの課題に対し、U1.5-Lite-Previewは生成ヘッドを再設計し、ビジュアルTokenグリッドが最終画像に与える影響を低減するとともに、トレーニングを4K解像度まで拡張しました。
画像編集に関しては、U1.5-Lite-Previewが編集データとトレーニングタスクを再構成し、元画像のコンテンツ、主体のアイデンティティ、空間構造、非編集領域を維持する能力を強化しました。これにより、目的の変更を実行しながら、元画像の変更する必要がない部分を可能な限り維持できます。
複数の能力強化により、U1.5-Lite-Previewは複数の主要な生成・編集品質評価ベンチマークでU1を大幅に上回りました。わずか8B-MoTの軽量モデル規模でありながら、商用クローズドモデルに匹敵する画像生成能力と編集効果を実現しています。
Qwen-Image-Benchは47.14から55.20に向上(with Prompt Enhance)
ImgEdit-Benchは3.90から4.37に向上
GEdit-Bench-enは7.47から8.17に向上
GEdit-Bench-zhは7.42から8.05に向上


SenseNova U1.5-Lite-Previewは現在、世界中のユーザーに向けてオープンソースで公開されています。ぜひ多くの開発者やクリエイターの皆さまにダウンロードしてお試しいただき、フィードバックやご提案をお寄せください。
GitHub:
https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face:
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
ModelScopeコミュニティ:
https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
U1からU1.5へのオープンソース化は、SenseTimeが基盤技術のイノベーションを継続的に進展させていることを示しています。同時に、プロフェッショナルユーザー向けの納品レベルの制作モデルU1 Proでは、現在招待制テストを精力的に進めており、近日中に一般向けサービスを開始する予定です。



リターンマッチ