
1. 为什么手机默认只输出1200万像素——从传感器排列说起先问一个不少人都困惑过的问题你花大几千买了台4800万像素、6400万像素甚至一亿像素的手机打开相机默认模式一拍照片信息里写的却是1200万像素、1600万像素甚至2700万像素。这不是厂商虚标也不是系统bug而是“像素四合一”Pixel Binning在起作用而Remosaic算法就是把四合一之后的低像素画面“拆”回高像素的关键一步。要理解Remosaic得先搞清楚手机影像传感器这些年到底发生了什么变化。早期手机传感器遵循经典拜耳阵列Bayer Array每个2x2的单元里分别是红、绿、绿、蓝四个滤色点一个1600万像素的传感器就是由1600万个这样的感光点组合而成。每个物理像素只能感知一种颜色后续通过去马赛克算法Demosaic把缺失的RGB信息补全最终才能得到一张彩色照片。但手机内部空间就那么大传感器面积被死死限制在1/1.3英寸、1/1.28英寸甚至更小的尺寸里。要想在同样面积下堆出4800万甚至1.08亿像素唯一的路就是把单颗像素的物理尺寸做小。像素做小带来的直接后果是单像素进光量下降、信噪比变差、暗光下噪点飞起。于是厂商把脑筋动到了排列方式上——将原本RGGB交错的拜耳阵列改成四个同色像素连成一组。这就是Quad Bayer排列也叫“四拜耳”。这种排列方式让传感器在高光比、暗光环境下可以通过“四合一”方式工作相邻2x2的四个同色像素合并成一整颗大像素输出感光能力等效于单像素面积乘以四。默认模式下4800万像素的Quad Bayer传感器输出1200万像素照片一亿像素传感器输出2500万或2700万像素照片道理完全一样。这不难理解——就像四个小桶放在一个大格子里光线暗的时候把小桶接到的水都倒进大桶再量量出来的水位自然比单个小桶高得多误差也小得多。但问题是用户总得有选择吧大白天拍风景、拍建筑、拍细节纹理的时候谁不想要真正的4800万甚至一亿像素画面这时候就需要一个“反操作”把已经合并或者本身就按四拜耳方式排列的RAW数据重新打散恢复成传统拜耳阵列的排列方式再走一遍标准图像的插值重建流程。这个打散、重排、插值的过程业界统称Remosaic。2. 拜耳阵列与Quad Bayer的本质差异一张图看懂两种排列的基因很多人把Remosaic理解成“像素切开”好像是把1200万像素的照片P大四倍变成4800万一样。这个理解错得比较远。要真正看懂Remosaic做的事情得先分清传统拜耳阵列和Quad Bayer在“基因”层面上的区别。传统拜耳阵列的排列可以记为RGGB第一行R、G、R、G循环第二行G、B、G、B循环以此类推。也就是说每个2x2小方块里固定有一颗红色感光点、一颗蓝色感光点、两颗绿色感光点。绿色占了一半是因为人类视觉系统对绿色最敏感也和人眼在可见光谱中的亮度感知峰值落在绿色波段有关。这种排列下每个“位置”的颜色信息是完全错开的相邻四个像素合在一起才能提供完整的RGB三通道基础信息。Quad Bayer则在结构上完全不同的逻辑它将四个同色像素直接排成一个2x2方块也就是一个“大红块”、一个“大蓝块”、两个“大绿块”拼成4x4结构。对传感器设计者来说这种排列的原始动机就是给“四合一”提供方便——硬件层面只需要把相邻四颗像素的电信号相加就能等效成一颗大像素。这种工作方式在暗光下极其有效代价却是你想输出全分辨率的时候整个传感器的原始排列不再符合拜耳阵列的规则。怎么理解这一步的差距我打个比方传统拜耳阵列好像一个按“红绿绿蓝”四色均匀交叉分布的调色盘每个色点本身就提供独有信息而Quad Bayer更像一个把四种颜色分别装进四个格子的收纳盒格子内部颗粒感很细但排列方式不再“交错”——想要得到传统拜耳阵列的完整RAW你必须把收纳盒里的细颗粒全部倒出来再按照RGGB的规律重新一枚一枚摆回去。但这里有一个关键问题Quad Bayer里每组2x2同色块只能提供一种颜色信息。当我们把它强行“还原”成拜耳阵列时原本应该交错出现的红绿蓝信息根本不存在于这四颗像素里。打个不严格的比方传统拜耳阵列的RGGB排列下任意2x2小方块都能提供一组完整的RGB基础数据而Quad Bayer的4x4结构里任意一个2x2小方块只能提供单一颜色相当于在空间分辨率维度上天然损失了颜色采样的交叠度。因此Remosaic从来不是简单“切开像素”或“一次性从传感器读出全部高像素”而是一个集合了重排列、插值重建、甚至深度学习推断的复杂算法链路。它需要“重建”的本质上不是像素的数量而是颜色信息的空间交错关系。明白这一点就不难理解为什么那些宣称“1亿像素模式”拍出来的照片放大看往往和原生中画幅相机的1亿像素完全不是一回事——因为两者的原始数据密度和信息量在物理层面上就存在差异。3. Remosaic重建链路拆解从“合并像素”到“全分辨率输出”现在进入核心环节——Remosaic到底是怎么把低分辨率图像恢复成高分辨率输出的我以最常见的Quad Bayer四合一传感器为例把整个处理链路拆开来讲。3.1 第一步读取RAW原始数据无论是4800万像素的IMX586还是1.08亿像素的HMX/HM3传感器输出的原始RAW都遵循Quad Bayer的排列方式。需要说明的是有些传感器的RAW有“合并输出”和“全分辨率输出”两种模式之分合并输出模式Binned RAW传感器直接在硬件层面把2x2同色像素合并输出一张1/4分辨率的Quad Bayer RAW。这相当于已经做完了像素合并ISP拿到的数据量就少。全分辨率输出模式Full-size RAW传感器不合并直接把四拜耳排列下的每一颗像素数据都读出来RAW文件体积很大后期处理自由度高。Remosaic通常发生在拿到“未合并”full-sizeRAW之后。如果拿到的是一张已经被合并成1200万像素的图那后面再怎么做Remosaic都只是超分插值物理信息已经丢了效果和直接在高分辨率RAW上重建完全不是一个级别。这也是为什么部分手机在专业模式或特定高像素模式下会直接输出full-size RAW让用户自己来决定要不要Remosaic。3.2 第二步像素拆解与重排Pixel Unpack假设我们拿到了来自IMX586的一张4800万像素Quad Bayer RAW。此时数据形态是图片左上角是4x4的最小重复单元包含一个2x2红色块、一个2x2蓝色块、两个2x2绿色块。Remosaic的第一步是把这四个2x2同色块“打散”将它们按RGGB的布局重新排列成一个标准的拜耳RAW。听起来简单实际做起来有个大坑打散之后原来一个2x2红色块所在的位置就只保留了一颗红色像素其余三个位置是空的同样绿色块、蓝色块各自留下的空缺都需要填上其他颜色信息。换句话说重排后的拜耳RAW是一张“稀疏”的图——每四个位置里只有一个有值其余三个必须靠后续算法推断出来。这一步是整条链路里最核心、也最考验算法的环节。常见的处理方法有以下几类最近邻复制Nearest Neighbor拿周边同颜色像素直接填进空缺位置。速度快但产生的边缘锯齿感明显容易出现马赛克基本只有低端方案才用。双线性/双三次插值Bilinear/Bicubic用空缺位置周围若干同色像素按距离加权求值。能一定程度上平滑边缘但对于高频细节头发丝、树叶缝隙依然力不从心。引导滤波/边缘感知插值Edge-guided Interpolation先估算当前像素所处位置的边缘方向再沿边缘方向插值避免跨越边缘扩散伪色。这类算法在传统ISP里很常见也是早期Remosaic的主要实现方式。深度学习重建用神经网络直接学习“从四拜耳RAW恢复高分辨率拜耳RAW”的映射函数一次性完成重排重建。3.3 第三步去马赛克Demosaic与后续处理重排完的拜耳RAW本质上还是一张“马赛克图”每个像素只有单通道颜色需要走一遍标准的去马赛克算法才能变成每一像素都具备RGB三通道的彩色图像。这一步和传统相机处理拜耳RAW的流程完全一致常见的做法包括基于梯度的插值、基于色比恒定性假设的方法如经典的Hamilton-Adams算法、以及基于深度学习的方法。这一步做完后面还要接白平衡校正、颜色校正矩阵、伽马校正、降噪、锐化等等一整条影像信号处理流程。所以在整个SoC的ISP链路里Remosaic模块一般插在RAW域预处理和Demosaic之间不是一个孤立的“后期滤镜”而是前置在标准成像流水线里的关键环节。3.4 为什么高像素RAW文件那么大从带宽视角看Remosaic的代价Remosaic最直接的代价就是数据量呈4倍增长。以4800万像素全分辨率RAW为例单张未压缩RAW约28MB如果是1200万像素合并RAW只有7MB左右。手机SoC的ISP、DSP、CPU和内存要在极短时间内处理4倍的数据功耗和发热同步上升快门延迟也会变长。这也是为什么很多手机在“高像素模式”下会明显感觉到处理更慢连拍速度也降下来。更尴尬的是由于传感器物理尺寸并没有变大Remosaic重建出来的4800万像素图片其实藏着大量插值信息而四合一模式下的1200万像素图虽然分辨率低但每颗像素都是原汁原味的物理信号。两种模式的画质差异要看具体场景。这也是下一节要展开的重点。4. 为什么普通用户很难拍好Remosaic照片——算法工程师视角的三大坑如果你在光线充足的大白天用一部4800万像素手机开“高像素模式”拍照得到的照片多半比默认模式更清晰细节更丰富。但一旦光线变暗高像素模式下的照片反而常常呈现涂抹感严重、噪点放大、伪彩色滋生的问题。这里面的门道得站在算法工程的角度才能看清。4.1 坑一物理进光量不足重建算法巧妇难为无米之炊Remosaic重建的前提是四拜耳排列下四个同色子像素各自都有独立光信号。但每个子像素的面积只有合并模式下等效面积的1/4。暗光环境下单颗小像素的信噪比大幅恶化光子散粒噪声逐渐占据主导。这种情况下重建算法不仅要填补缺失的颜色信息还要面对充满噪声的输入信号结果自然是噪声一起被放大。很多照片放大后出现的彩色噪点和“水彩纹理”根源就在这里。我见过不少用户拿108MP模式在室内拍猫猫毛边缘全是粉红、浅绿交替的伪色纹路。这正是暗光下小像素信噪比不足和插值过程双重作用的结果。4.2 坑二边缘方向误判引发伪彩与锯齿传统基于边缘方向估计的插值算法有个通病在纹理极其复杂的区域比如树叶缝隙、百叶窗栅栏边缘方向很难被准确估计。方向估错了插值就会跨过边缘去“污染”相邻区域产生拉链状锯齿和伪彩。解决这类问题通常要跑更复杂的迭代式边缘修正算法计算量成倍增长手机ISP的功耗和延迟都扛不住所以最后往往采用折中方案——稍微牺牲一点边缘锐度换取更稳定的色彩表现。4.3 坑三RAW域降噪和Remosaic的顺序问题传统拜耳RAW的降噪可以直接在RAW域进行因为每个像素都有真实信号。但Quad Bayer RAW在做完重排后大部分像素位置其实是插值生成的不是真实信号。如果在Remosaic之前先做降噪那么降噪算法会把同色块内部四颗像素的噪声特性一并处理效果还可以但如果先重排、后降噪相当于降噪算法要面对大量含插值误差的像素很容易把重排过程中引入的误差当成真实纹理保留下来。所以有经验的影像调试工程师会更倾向于优先在Quad Bayer原域先做一次轻度降噪再进行Remosaic重排最后在拜耳域再做一轮降噪。不过这个顺序会占用两级RAW域处理资源部分中端SoC根本跑不下来于是只能简化流程最终成品照片的算法痕迹就会重一些。4.4 为什么说“高像素模式适合风光不适合夜景”——场景选择逻辑这些年用过不少手机我的实际操作习惯是白天光线充足打开4800万/一亿像素模式记录建筑、风景、静态物件的纹理细节黄昏或室内光线不均匀时切回默认12MP/16MP四合一模式追求干净的画面和更高的动态范围。夜景长曝光更是别碰高像素模式手持场景下高像素RAW的读取噪声和算力消耗都会让体验明显变糟。顺便提一嘴部分手机厂商的“夜景模式”其实是多帧合成方案连续抓拍若干张低分辨率四合一RAW在时域上堆栈降噪再配合Remosaic重建出高分辨率输出。这种“先堆栈再重建”的做法比单帧Remosaic效果好得多代价是快门时间拉长拍不了快速运动的物体。5. 各家方案的差异与取舍从IMX586到一亿像素的演进Remosaic不是一家独门技术从索尼IMX586、三星GW1到三星HMX/HM3和小米定制的OV48C但凡采用四拜耳排列的高像素传感器都绕不开Remosaic这一环。但各家在具体实现上的取舍很不一样。5.1 输出RAW还是输出成片两种处理路径一部分方案尤其早期中端机型把Remosaic放在SoC的ISP内部用户按下快门后ISP直接把Quad Bayer RAW重排、插值、输出一整套拜耳域数据最后直接出片。这种方式对计算资源需求高算法调整空间小好处是延迟低。另一部分方案则选择在RAW域就把不再做完整出片而是把full-size的Quad Bayer RAW交给后端骁龙平台的Spectra ISP、天玑平台的Imagiq ISP等进行重排重建。这种方案的灵活性更高厂商可以针对自己的影像风格做调试甚至让用户后期在图库App里直接调用“超清增强”重新处理RAW。5.2 像素尺寸与输出分辨率的对应关系决定Remosaic最终画质上限的因素除了算法之外最关键的还是传感器本身的物理特性。以三星HMX一亿像素、1/1.33英寸、单像素0.8微米为例其四合一之后等效单像素1.6微米输出2700万像素而IMX5864800万像素、1/2英寸、单像素0.8微米四合一后等效1.6微米输出1200万像素。两者单像素尺寸相同但像素总量和传感器面积完全不同所以HMX在光照充足时能记录更多物理细节。高像素传感器的另一个隐藏优势是“裁切自由”。当你用一亿像素传感器以12MP模式拍完一张照片再在后期把画面裁掉3/4剩下的区域仍然有足够的像素做输出。这种“数字变焦”体验远好于传统传感器放大截图也是为什么很多长焦镜头方案选择高像素主摄裁切而不是额外加一颗物理长焦。5.3 小米、三星、苹果的路线差异苹果至今没有跟风堆高像素iPhone主摄长期停留在12MP直到iPhone 14 Pro才升级到48MP并采用四拜耳排列默认输出24MP也提供48MP ProRAW选项。iPhone的做法很有意思默认输出没有走传统的四合一12MP而是通过计算摄影合并多帧数据之后在最终成像上获得更多细节。这套方案本质上已经不是纯粹的传感器硬件工作模式而是“多帧合成智能降噪超分”的组合拳。三星在自家旗舰上则非常依赖Remosaic。Galaxy S系列的一亿像素模式晴天室外手持拍摄建筑外墙的砖缝、树叶的脉络、远处招牌的文字都能得到真实锐利的还原。用网友的话说“一亿像素模式是三星影像的灵魂”。小米数字系列旗舰同样搭载了定制的一亿像素/五千万像素传感器默认模式输出1250万或2500万像素但提供独立的“高像素模式”入口成片质量和直接抓拍的速度体验存在明显差异。5.4 为什么不直接全默认输出高像素既然高像素模式白天能拍到更多细节为什么厂商不默认全开答案其实在功耗和算力上。一亿像素RAW的读取需要ISP在极短时间内处理几十MB数据连续按下快门几次手机温度就会明显上升快门延迟也成倍拉长。还要考虑多帧HDR和夜景模式下的数据量一亿像素RAW再叠加多帧堆栈内存带宽直接爆炸发热降频让体验瞬间崩坏。所以主流厂商的做法都是默认“四合一黑盒模式”让用户根据场景手动切入高像素模式。这是一套非常合理的折中方案在手机这种空间和散热都捉襟见肘的设备上不可能每一拍都全功率处理1亿个感光点的数据。6. 从Remosaic延伸出去的思考插值重建算法的边界与未来Remosaic只是影像计算链路里的一环但围绕它的讨论几乎可以映射出整个计算摄影领域的基本问题——如何在信息有限的前提下重建出看起来远比物理数据更丰富的画面这类问题的本质是所有超分辨率算法共同面对的核心矛盾。6.1 超分辨率算法的三种思路对比超分辨率重建大体有三个方向基于插值、基于重建约束、基于学习。基于插值的方法双线性、双三次运算量极低适合实时场景但细节恢复能力有限放大超过两倍就开始发虚。基于重建约束的方法如迭代反投影效果好于纯插值但迭代过程计算量大对噪声敏感在手机场景里很少单独使用。目前真正扛大梁的是基于学习的超分方案尤其是深度学习模型——通过大量成对的高低分辨率图像训练让网络学会从模糊的输入中推断锐利细节。Remosaic里的深度学习重排本质上是把“四拜耳到拜耳阵列的颜色重建”当成了一个特殊的超分任务输入是稀疏的Quad Bayer RAW输出是稠密的拜耳域RAW。这类方法已经在主流旗舰机上逐步普及尤其在暗光高像素模式下相比传统插值有明显优势。6.2 判定插值质量的几个硬指标如果你也想在项目里评估Remosaic或超分算法的好坏建议重点看几个客观指标色彩伪影程度观察黑白边缘、高饱和色块边界附近是否出现红绿/蓝绿杂色边缘振铃Ringing高对比边缘处有没有像水波一样的明暗交替细节保留度用特定频率条纹图卡SFR测试卡测量重建后的空间频率响应均匀区域噪声表现纯色墙、天空等低频区域放大后会不会出现“水渍”状图案。主观体验层面我个人更关注的是“纹理的真实感”。有些算法能重建出极其锐利的边缘但背景墙面、皮肤毛孔的高频噪声也跟着一起被放大看起来特别“数码味”。好的Remosaic应当是在保留真实纹理的同时避免过度锐化带来的塑料感。6.3 未来的方向端到端计算摄影将让Remosaic“隐形”可以明显感觉到这几年Remosaic已经从最初商家宣传的“黑科技”变成了手机影像链路里一个默认存在的底层技术。未来随着端侧AI算力的提升手机不会再单独划分一个“高像素模式”入口而是由算法根据场景自动判断当前应该输出多少像素、融合多少帧、重建多少细节。整套流程将以完全自动化的方式运行在用户无感知的底层Remosaic这个词也会像“对焦”“曝光”一样变成纯粹的技术背景名词。不过从爱好者角度看我还是建议大家了解这层逻辑。因为当你理解了手机默认拍出来的图为什么会“小”、高像素模式在什么场景才值得开、以及那些“1亿像素”成片背后的成像原理时你对手机影像能力的认知就不会只停留在“像素越高越清晰”这句广告语上——这应该算是数码玩家绕不开的一门基础课了。