画像中の重要領域の抽出と高能率符号化への応用
画像中の重要領域の抽出と高能率符号化への応用
批准号:
11750313
负责人:
長井 隆行
金额:
$1.41万
依托单位国家:
日本
项目类别:
Grant-in-Aid for Encouragement of Young Scientists (A)
财政年份:
1999
资助国家:
日本
项目状态:
已结题
起止时间:
1999 至 2000
中文摘要
本研究は、画像中の重要な領域を自動抽出し、その領域をより詳細に符号化することで、より効率よく画像情報を圧縮する手法の実現を目的として行った。本研究の成果は以下の通りである。1.ベースとなる画像符号化の性能向上フィルタバンク(ウェーヴレット)をベースとした画像符号化の性能向上のために、周波数帯域によって異なる基底長を持つ新しいフィルタバンクの構造と設計法を提案した。これにより、復号画像の品質向上を図った。また、提案するフィルタバンクが、seismic dataの圧縮に有効であることも明らかにした。2.重要領域を考慮した画像符号化方式上記のフィルタバンクをSPIHT符号化に適用し、さらに抽出した重要領域を重み付けすることにより重要領域を考慮した画像符号化を実現した。実際の画像を用いて主観評価実験を行い、有効性を確かめた。3.重要領域の定義と抽出手法画像中の重要領域のひとつとして、人間の顔を定義し、その抽出手法を検討した。具体的には、カラー静止画像の場合は、固有空間と色(肌の色)を用いて抽出を行い、動画像の場合は、抽出した顔領域を色情報により高速にトラッキングする手法を実現した。また、画像中の重要領域の二つ目として文字領域を定義し、その抽出手法を検討した。画像中の文字領域は、ウェーヴレット変換、独立成分分析、特徴空間からの距離の3つを組み合わせて特徴とし、ニューラルネットワークによって大量のデータから学習することで高い抽出精度を実現した。4.音声を併用した重要領域の抽出入力信号として、多チャンネルの音声が得られる時、これを用いて話者位置を推定し、その結果を画像符号化に反映させることを検討した。このためにまず、複数のマイクを2次元的に配置し、話者の位置を推定する手法を提案した。これにより、画像中のどの話者が現在発話しているかを知ることができ、動画像符号化に反映させることが可能となる。5.重要領域抽出と画像符号化手法の統合上述の顔領域抽出手法と画像符号化方式を統合し、PC上に実装した。
英文摘要
本研究は、画像中の重要な領域を自動抽出し、その領域をより詳細に符号化することで、より効率よく画像情報を圧縮する手法の実現を目的として行った。本研究の成果は以下の通りである。1.ベースとなる画像符号化の性能向上フィルタバンク(ウェーヴレット)をベースとした画像符号化の性能向上のために、周波数帯域によって異なる基底長を持つ新しいフィルタバンクの構造と設計法を提案した。これにより、復号画像の品質向上を図った。また、提案するフィルタバンクが、seismic dataの圧縮に有効であることも明らかにした。2.重要領域を考慮した画像符号化方式上記のフィルタバンクをSPIHT符号化に適用し、さらに抽出した重要領域を重み付けすることにより重要領域を考慮した画像符号化を実現した。実際の画像を用いて主観評価実験を行い、有効性を確かめた。3.重要領域の定義と抽出手法画像中の重要領域のひとつとして、人間の顔を定義し、その抽出手法を検討した。具体的には、カラー静止画像の場合は、固有空間と色(肌の色)を用いて抽出を行い、動画像の場合は、抽出した顔領域を色情報により高速にトラッキングする手法を実現した。また、画像中の重要領域の二つ目として文字領域を定義し、その抽出手法を検討した。画像中の文字領域は、ウェーヴレット変換、独立成分分析、特徴空間からの距離の3つを組み合わせて特徴とし、ニューラルネットワークによって大量のデータから学習することで高い抽出精度を実現した。4.音声を併用した重要領域の抽出入力信号として、多チャンネルの音声が得られる時、これを用いて話者位置を推定し、その結果を画像符号化に反映させることを検討した。このためにまず、複数のマイクを2次元的に配置し、話者の位置を推定する手法を提案した。これにより、画像中のどの話者が現在発話しているかを知ることができ、動画像符号化に反映させることが可能となる。5.重要領域抽出と画像符号化手法の統合上述の顔領域抽出手法と画像符号化方式を統合し、PC上に実装した。
期刊论文(12)
专著(0)
科研奖励(0)
会议论文
登录
查看更多内容
T.Nagai,M.Ikeharu,M.Kaneko A Kurematsu: "Generalized Unequal Length Lapped Orthogonal Transform for Subband Image Coding"IEEE Tran.on Signal Processing. Vol.48 No.12. 3365-3378 (2000)
T.Nagai、M.Ikeharu、M.Kaneko A Kurematsu:“用于子带图像编码的广义不等长重叠正交变换”IEEE Tran.on 信号处理。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
T.Nagai,K.Kondo,M.Kuneko,A.Kurematsu: "Estimation of Source Location Based on 2-D MUSIC and Its Application to Speech Recognition in Cars"Proc.of IEEE Int.Conf.on Acoustics, Speech and Signal Processing 2001(ICASSP 2001). (to appear).
T.Nagai,K.Kondo,M.Kuneko,A.Kurematsu:“基于 2-D MUSIC 的源位置估计及其在汽车语音识别中的应用”Proc.of IEEE Int.Conf.on Acoustics, Speech and Signal
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
T.Nagai,M.Ikehara,M.kaneko A.Kurematsu: "Generalized Unequal Length Lapped Orthogonal Transform for Sub band image Coding"Proc.of IEEE Int.Conf.on Acoustic, Speech and Signal Processing,2000 (ICASSP 2000). 520-523 (2000)
T.Nagai、M.Ikehara、M.kaneko A.Kurematsu:“用于子带图像编码的广义不等长重叠正交变换”Proc.of IEEE Int.Conf.on Acoustic、Speech and Signal Processing,2000 (ICASSP 2000)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
長井隆行,影広達彦,金子正秀,榑松明: "情景画像中の文字及び看板領域の抽出"電子情報通信学会 信学技報. (発表予定).
Takayuki Nagai、Tatsuhiko Kagehiro、Masahide Kaneko、Akira Kure:“从场景图像中提取文本和招牌区域”IEICE 技术报告,IEICE(待提交)。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
T.Nagai,K.Kondo,M.Kaneko A.kurematsu: "Estimation of Speaker's Location using 2-D MUSIC and Its Application to Car Speech Recognition"Proc.of Int, Workshop on Hands-Free Speech Communication. (to appear).
T.Nagai、K.Kondo、M.Kaneko A.kurematsu:“使用 2-D 音乐估计说话者的位置及其在汽车语音识别中的应用”Proc.of Int,免提语音通信研讨会。
DOI:
--
发表时间:
期刊:
影响因子:
--
作者:
[]
通讯作者:
共 6 条
こどもの非認知能力発達の計測とモデル化
-
批准号:21F20798
-
项目类别:Grant-in-Aid for JSPS Fellows
-
资助金额:$1.47万
-
财政年份:2021
-
负责人:長井 隆行
-
依托单位:
動画像のアピアランスモデルとその応用に関する研究
-
批准号:16760293
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$2.24万
-
财政年份:2004
-
负责人:長井 隆行
-
依托单位:
認識をベースとした音声・画像の広帯域化とその応用に関する研究
-
批准号:14750282
-
项目类别:Grant-in-Aid for Young Scientists (B)
-
资助金额:$0.77万
-
财政年份:2002
-
负责人:長井 隆行
-
依托单位: