dvmark:ビデオウォーターマーキングのための深層多尺度フレームワーク

dvmark:ビデオウォーターマーキングのための深層多尺度フレームワーク

DVMark:多尺度深層学習に基づくビデオ透かしフレームワーク ビデオ透かし技術は、ビデオに情報を埋め込むことでデータの隠蔽を実現します。本論文で提案するDVMarkモデルは、多尺度深層学習に基づくビデオ透かしのソリューションであり、高い堅牢性と実用性を備えています。ビデオの品質を維持しながら、さまざまな失真や攻撃に対抗することができます。 背景と動機 ビデオ透かし技術は、メッセージをビデオに埋め込むことで、視覚的に見えるものと見えないものがあります。見えない透かしは、オリジナルの内容を邪魔しないため、攻撃者に検知されにくいという利点があります。透かしは、ビデオのメタデータ、タイムスタンプ、作者情報など、さまざまなシーンで利用されます。また、透かしは情報の監視や追跡にも広く利用されています。...

セマンティックセグメンテーションのためのスタック型デコンボリューションネットワーク

セマンティックセグメンテーションのためのスタック型デコンボリューションネットワーク

セマンティックセグメンテーションのためのスタック反畳み込みネットワーク はじめに セマンティックセグメンテーションはコンピュータビジョン分野における重要なタスクであり、画像の各ピクセルを分類してそのカテゴリを予測することを目指しています。しかし、既存の完全畳み込みネットワーク(Fully Convolutional Networks, FCNs)は、空間解像度の処理において制限があり、物体の境界がぼやけたり小さな物体が見逃されたりする問題があります。これらの問題を解決するために、本論文ではセマンティックセグメンテーションの効果を向上させるために、スタック反畳み込みネットワーク(Stacked Deconvolutional Network, SDN)を提案します。 研究背景 深層畳み込み神経...

FP-AGE:野生環境における顔の年齢推定のための顔解析注意の活用

FP-AGE:野生環境における顔の年齢推定のための顔解析注意の活用

FP-Age:顔解析注意メカニズムを利用した自然環境における顔年齢推定 研究背景 顔画像での年齢推定は、計算機視覚における重要なタスクです。それは法医学、セキュリティ、健康福祉、ソーシャルメディアなど幅広い実際の応用において大きな可能性を秘めています。しかし、頭部の姿勢、顔の表情そして遮蔽など多様な要因の存在により、深層学習モデルの顔年齢推定分野での性能はまだ向上の余地があります。特に、自然環境(”in-the-wild”)の顔画像においてこれらの問題は一層顕著です。異なる条件下でのモデルのロバスト性と精度を向上させるため、著者は顔の意味情報を年齢推定プロセスに組み込む新しい方法を提案しました。これにより、モデルが最も情報量の多い顔領域に効果的に注目できるようになります。 研究者と発表情報 ...

TGFuse:トランスフォーマと生成対向ネットワークに基づく赤外線および可視画像融合アプローチ

TGFuse:トランスフォーマと生成対向ネットワークに基づく赤外線および可視画像融合アプローチ

TGFuse:Transformerと生成対抗ネットワークに基づく赤外線と可視光画像の融合方法 背景紹介 イメージング機器と分析方法の発展に伴い、多環境ビジュアルデータが急速に出現し、多くの実際の応用を持っています。これらの応用の中で、画像融合は多環境データの情報関連を人間の目で理解するのに重要な役割を果たしています。特に赤外線と可視光画像の融合は、軍事、安全、視覚追跡などの分野で重要な応用があります。このため、画像融合任務の重要な一環となっています。自然かつ効果的な画像融合アルゴリズムを設計することができれば、全体的な画像の知覚を向上させ、複雑なシーンの融合要求に適応することができます。しかし、既存の畳み込みニューラルネットワーク(CNN)ベースの融合方法は、遠距離依存性を直接無視してしま...

監督なしの時間的一致性学習を用いた統一的なビデオオブジェクト除去

監督なしの時間的一致性学習を用いた統一的なビデオオブジェクト除去

ビデオオブジェクトの一貫性削除における非監督型時間一致性学習 研究背景と動機 ビデオ編集と修復の分野において、ビデオオブジェクト削除(Video Object Removal)は重要なタスクです。その目標は、ビデオ内の目的のオブジェクトを消去し、合理的な内容で穴を埋めることです。既存のソリューションは主に2つのサブタスクに分かれます:(1) マスク追跡(Mask Tracking)と (2) ビデオ補完(Video Completion)。しかし、これらは通常独立した問題と見なされ、それぞれ別個に処理されます。このような分割はシステムを過度に複雑にし、複数のモデルの協同作業が必要となり、トレーニングとデプロイの難易度を増し、実際の応用に不利です。 論文は、マスク追跡とビデオ補完がピクセルレベ...

CLASH: 歩行認識のためのニューラルアーキテクチャ検索を使った補完学習

CLASH: 歩行認識のためのニューラルアーキテクチャ検索を使った補完学習

CLASH:補完学習とニューラルアーキテクチャ検索に基づく歩容認識フレームワーク 研究背景 歩容認識は、個人の歩行パターンを通じて身元を識別するバイオメトリクス技術である。この技術は、遠距離から個人の協力を必要とせずに行うことができるため、セキュリティチェック、ビデオ検索、身元識別などの分野で広く応用されている。しかし、人影の輪郭に基づく識別方法にはいくつかの問題がある。二値化されたスパースな境界表現は豊富な時空間情報を欠いており、輪郭の大部分のピクセルが歩容パターンに対して敏感ではない。このため、識別のロバスト性を維持しつつ、歩容パターンに対する感度を高めるために、本文ではニューラルアーキテクチャ検索に基づく補完学習(Complementary Learning with Neural A...