原核表达系统干了这么多年从最开始的盲目试条件到后来慢慢把转录、翻译、折叠这条链路真正想通踩过的坑比做过的实验还多。今天把整个分子机制从头到尾拆一遍从启动子怎么被σ因子识别到核糖体在mRNA上的加载速率怎么决定翻译量再到新生肽链如何被分子伴侣网络拽进正确折叠路径全部串起来讲清楚。这篇东西适合刚接触原核表达的学生也适合在实验室里反复折腾表达条件的同行——看懂机制之后你再调条件就不是瞎试而是每一步都有依据。1. 整体设计思路拆解为什么要从分子机制层面重新理解原核表达1.1 原核系统的高产秘密本质上是同步性的胜利做原核表达大家第一反应就是大肠杆菌BL21(DE3)IPTG一加蛋白哗哗出来。但你有没有想过为什么同样一个载体换到不同菌株、不同温度、不同诱导浓度产量能差出十倍甚至百倍答案不在运气而在转录、翻译、折叠三个环节的时序配合。大肠杆菌的生长速度大概20至30分钟一代这意味着它可以在一个工作日内完成几十次细胞分裂。这种快速增殖特性决定了它的转录和翻译是紧耦合的——mRNA还在转录核糖体就已经挂上去开始翻译这叫做共转录翻译。在原核系统里没有真核生物那种细胞核与细胞质的物理隔离也没有RNA剪接加工新生mRNA的5端刚露出来就能被核糖体识别。这套设计的好处是响应快、产率高但代价是蛋白折叠经常跟不上翻译速度容易形成包涵体。真正的高手不是上来就挂一个大标签、调一次IPTG浓度就完事而是理解这三个环节各自受什么因素控制然后在关键点上做文章。我们这篇文章要拆的就是这三条线交织在一起的核心逻辑。1.2 转录、翻译、折叠三根支柱的耦合关系把原核表达看成一条流水线转录是复制图纸翻译是按图生产折叠是质量检验和组装。图纸数量太少产量上不去图纸太多但产线核糖体加载不过来mRNA白瞎产线速度太快组装车间人手不够次品率高。具体到分子机制上三根支柱各自的瓶颈都不一样转录层面启动子强度、σ因子选择性、诱导剂浓度、质粒拷贝数决定mRNA的产量上限。翻译层面核糖体结合位点的序列、起始密码子两侧的二级结构、密码子偏好性、tRNA丰度决定每条mRNA能产出多少蛋白分子。折叠层面新生肽链的空间结构信息、分子伴侣和折叠酶的识别效率、细胞质氧化还原环境决定蛋白是否正确折叠、有没有活性。这三层不是孤立的。翻译速度快会导致折叠来不及折叠中间态不稳定会被蛋白酶降解降解产物又会反馈影响后续翻译效率。所以你调任何一个参数都要考虑它对其他两层的影响。1.3 选系统之前想清楚要产量、要活性还是要正确性很多人上来就问用什么载体、什么菌株但我建议先问自己你这个蛋白要拿来干什么如果目标是做抗原、做结构生物学筛选那高产量的包涵体其实无所谓反正是要复性的如果目标是做酶活研究、做抗体药物靶点互作那就必须保证可溶性和正确折叠如果目标是做同位素标记的NMR样品那还要考虑培养基成分和诱导时机。三种需求对应的策略完全不同高产路径强启动子T7高拷贝质粒37℃快速诱导追求单位体积产量。可溶路径弱启动子或渗漏表达低温慢速诱导共表达分子伴侣降低翻译速度。修饰路径需要信号肽导向周质空间或者使用带分泌功能的载体系统。这个判断必须放在最前面。跳过这一步后面所有优化都是盲目的。2. 转录调控决定mRNA数量上限的第一个闸门2.1 启动子结构的核心逻辑-10区和-35区如何被σ因子识别原核启动子最核心的元件是两段保守序列-35区的TTGACA和-10区的TATAAT两者之间间隔通常是17±1个碱基。别小看这个间隔它决定了σ因子与DNA双螺旋的相对空间位置。σ因子是一个可辨认的识别模块它让RNA聚合酶核心酶结合到正确的位置、解开DNA双链、启动转录。我调启动子的时候特别注意间隔距离。如果你改启动子序列把间隔从17bp改成15bp或19bp转录效率会断崖式下降因为σ因子的结构域必须同时接触两段序列。很多人在构建启动子突变体时忽略这个细节以为只要-10和-35区序列对就行结果表达量掉了几个数量级还找不到原因。另外要注意启动子强度与σ因子的丰度和竞争有关。大肠杆菌里有多个σ因子比如σ70负责大多数看家基因的转录σ32负责热休克基因σ54参与氮代谢调控。当细胞处于热应激时σ70被部分替换这时候如果你用的是依赖σ70的启动子转录效率会明显下降。所以做高温诱导实验前要意识到这不是简单的化学问题还涉及σ因子竞争。2.2 诱导表达系统的选型T7、lac还是araB最常见的三大类原核表达启动子系统各有各的脾气T7系统pET系列T7 RNA聚合酶极其高效转录速度远快于大肠杆菌自身的RNA聚合酶mRNA产量极高。但它的问题在于太强了在非诱导条件下也常有渗漏表达对有毒蛋白是致命的。解决办法是使用含有T7 lysozyme的宿主菌株如BL21(DE3)pLysS压制基底转录或者用葡萄糖抑制lac启动子的渗漏。T7系统追求的纯粹是产量如果目标是可溶性蛋白这个系统反而不是首选。lac系统pGEX、pMAL等受lacI阻遏蛋白调控诱导剂是IPTG。相对于T7转录速率温和得多且可以通过调节IPTG浓度精细控制转录水平。但lac系统的最大坑在于当加入IPTG后阻遏蛋白被解除群体细胞转录是同步的翻译负荷突然爆发很多蛋白在这个爆发点直接形成包涵体。araB系统pBAD系列受araC蛋白调控诱导剂是阿拉伯糖。这个系统的优点是响应曲线特别平滑你可以在很宽的浓度范围内调节表达速率非常适合表达毒性蛋白或对正确折叠要求高的蛋白。实操中我的经验是对未知蛋白优先用pBAD或温和的lac系统做小试把条件摸清楚再转到高产的pET系统放大产量。直接上pET前面诱导条件没摸透的话大概率会收获一坨沉淀。2.3 转录终止与mRNA稳定性表达量取决于mRNA的寿命和尾巴启动子只是决定转录的起始频率mRNA能活多久同样决定蛋白产量。大肠杆菌内mRNA半衰期通常只有2到5分钟这是因为RNase E等核酸酶会快速降解转录本。核糖核酸酶的切割往往起始于mRNA的5磷酸端所以如果mRNA5端有稳定的二级结构比如一段发夹就能显著减缓降解速率。还有一类天然耐降解的结构是双链区域。pET系列载体一般自带T7终止子但这不仅仅是为了终止转录更重要是使mRNA3端形成稳定的发夹结构保护poly(A)尾缺失时不被3→5外切酶吞噬。有些改良载体在翻译区下游加一段保护性序列实测mRNA水平能提升2到3倍。所以在设计合成基因时不要在编码序列末尾直接放一个裸露的终止密码子就完事要在它下游留结构化区域。很多公司提供的密码子优化序列都考虑到了这点但如果是自己手动设计老式载体非常容易忽略。2.4 转录调控实操强度匹配才是关键实际操作中我不会只追求最强启动子我追求的是匹配的转录强度。比如做一个酶法催化用的蛋白需要大量可溶活性酶转录速度适中、翻译速度协调最佳。这时候我可能选择lac启动子但搭配低拷贝数的质粒骨架如pACYC衍生载体这样mRNA总量不高每个mRNA也有充足的核糖体加载空间蛋白折叠压力小。如果是做结构生物学样品追求的是mg级别的纯化产量包涵体复性或变性纯化后能拿到蛋白即可那我就会放开T7高表达37℃快速诱导4小时收获包涵体。这里补一个之前踩过的坑我在发酵罐放大时用添加葡萄糖的LB培养基做种子结果IPTG诱导后一小时发现产率低得离谱。反复排查发现是葡萄糖浓度过高抑制了lac启动子的活性即使加了IPTG启动子也无法快速切换到高转录状态。注意这不是阻遏蛋白的问题而是cAMP-CAP机制的葡萄糖效应干扰了启动子的正调控。之后改成补料分批控制葡萄糖浓度低于0.5 g/L问题才解决。3. 翻译动力学核糖体加载速率决定蛋白质分子的命中率3.1 RBS设计核糖体怎么找到mRNA以及为什么SD序列不是万能钥匙原核翻译起始的关键是mRNA上的核糖体结合位点RBS核心是Shine-DalgarnoSD序列一段富含嘌呤的序列如AGGAGG与16S rRNA的3端反SD序列互补配对。核糖体小亚基靠这段互补配对结合mRNA然后在核糖体蛋白和起始因子帮助下定位到起始密码子AUG。问题在于SD序列的配对强度不是越高越好。太强配对会导致起始复合物卡住、难以松开太弱配对又让核糖体找不到位点。最佳解是在一个合适的解离常数范围内。另外SD序列与起始密码子之间的间隔通常5到9个核苷酸必须合适这段间隔的序列如果形成茎环结构会直接遮蔽SD序列或起始密码子导致翻译效率暴跌。我当时用RBS计算器如Salis的RBS Calculator设计了一批变体发现同样的SD核心序列仅仅改变间隔区2个碱基表达量就出现了约8倍差异。所以如果你在纠结表达量上不去不要急着改密码子先检查起始区域是不是藏着二级结构。3.2 密码子偏好性与tRNA丰度不是所有密码子都平等大肠杆菌不同密码子对应的tRNA丰度差异巨大。比如编码亮氨酸的CTG对应的tRNA丰度就很高而编码精氨酸的AGG/AGA对应的tRNA丰度就很低。当你的目标蛋白序列里密集出现稀有密码子核糖体就会在那里堵车把整个翻译进程拖慢有时还会引发翻译提前终止或移码错误。我在表达一个富含脯氨酸的膜蛋白片段时序列里有两个连续的CCC脯氨酸稀有密码子产量只有可溶性的10%。密码子优化之后同样条件下产量提升到原来的6倍。核心原因就是翻译延伸的速度均匀了新生肽链没有长时间停留在一个位置等稀有tRNA从而避免折叠中间态过度堆积。不过密码子优化也要注意刹车策略。有一些蛋白的正确折叠依赖于翻译过程中的短暂停顿让N端先折叠为后面结构搭建模板。如果你的密码子优化把所有翻译停顿都消除折叠效率反可能下降。这就是为什么现在的优化软件都支持定制障碍参数在关键位置保留慢密码子。3.3 翻译延伸与共翻译折叠核糖体不是只管生不管养核糖体沿着mRNA运动时新生多肽链从核糖体出口通道冒出。这条通道内径仅约2 nm左右刚刚好够容纳α螺旋而β折叠片和更复杂的结构必须在通道外形成。新生链从通道出来后先接触的是触发因子Trigger factor, TF这是原核生物里第一个和新生链结合的分子伴侣。TF像一个看护人在核糖体附近等待刚露头的多肽片段保护它们不在拥挤的细胞质里被错误聚集。如果TF缺失或浓度过低很多蛋白会变成不溶性聚集体。有意思的是TF与核糖体的结合位点会和信号识别颗粒SRP竞争。如果你的蛋白带强疏水跨膜区SRP会优先登场并引导蛋白到膜上翻译和膜转位耦合进行。这个机制对于表达膜蛋白非常重要也是为什么大肠杆菌表达膜蛋白经常需要融合T4溶菌酶或GFP来提高正确插入膜的概率。翻译延伸速率不是恒定不变的它受氨基酸供应、tRNA充电状态、新生肽链与通道的相互作用影响。在营养丰富的丰富培养基里翻译速度更快但折叠系统跟不上在基本培养基里翻译速度慢折叠质量往往更好。这是慢下来做精的经典例证。3.4 翻译优化策略N端规则、mRNA二级结构和引物设计翻译优化的一个高效手段是调整N端氨基酸序列遵循N端规则。大肠杆菌的N端甲硫氨酸氨基肽酶MAP能移除起始甲硫氨酸之后N端的第二个氨基酸决定蛋白半衰期。如果第二位氨基酸是精氨酸、赖氨酸、亮氨酸等蛋白容易被ClpAP等蛋白酶识别降解如果第二位是甘氨酸、丙氨酸、丝氨酸等蛋白通常稳定积累。因此在设计成熟蛋白的N端时我通常会检查第二位氨基酸通过同义突变把B区氨基酸换成稳定化氨基酸同时不影响酶活性。这个操作在某些蛋白上能直接解决表达蛋白含量高但检测不到信号的经典难题。另外翻译起始区的mRNA二级结构要尽可能开放。AUG起始密码子最好位于单链区SD序列上游避免长茎环。我常用的验证方法是用mfold或RNAfold预测起始区30个核苷酸内的自由能。自由能越低越负二级结构越稳定核糖体越难打开翻译起始越差。目标是把起始区域内二级结构的自由能控制在-5 kcal/mol以上也就是说结构不要太紧。这里补充一个容易被忽略的点原核基因的翻译要和转录速率匹配。加入IPTG后转录瞬间达到最高速但核糖体加载是渐进的这个时间差会造成mRNA前端堆积大量无核糖体覆盖的区域容易被RNA酶切割。这就是为什么快速诱导往往不如温和步进式诱导先低浓度诱导一段时间再补加产量高。4. 蛋白折叠路径从新生链到有活性构象的生死竞速4.1 分子伴侣网络GroEL/GroES与DnaK/DnaJ的接力赛大肠杆菌的折叠体系是一张庞大的协作网络。新生肽链从核糖体出来第一站通常是TF如果多肽疏水片段较多TF会把它交给DnaK/DnaJ/GrpE系统。这套系统有点像中转站DnaJ识别并递送底物DnaK结合后通过ATP水解驱动多肽构象重排再释放出来。很多中等大小的蛋白经过这个重复结合-释放循环就可以折叠出正确构象。如果蛋白还是没能正确折叠就会被送入GroEL/GroES这个折叠桶里。GroEL是一个由14个亚基组成的双层笼状结构底物进入中央孔道GroES像盖子一样盖上在隔离空间里让蛋白单分子重新折叠。这个过程消耗大量ATP但有效防止了蛋白聚集。我在表达一个由多个结构域拼接成的融合蛋白时分子伴侣的协作尤为重要。这个融合蛋白有一段高疏水连接区单独表达时可溶性很差。后来我在载体里共表达GroEL-GroES系统可溶性从15%提升到65%以上。这里注意共表达伴侣自身会占用合成资源要让伴侣基因的启动子弱于目标基因否则伴侣蛋白反而占了表达量。4.2 包涵体形成的机理为什么看得见的产量不等于能用的蛋白包涵体是大肠杆菌表达过量蛋白时形成的非晶态聚集体主要由部分折叠或错误折叠的蛋白组成有时还混杂核酸和脂质。形成包涵体的一个主要原因是目标蛋白的翻译速度远快于分子伴侣的折叠处理能力新生链上的疏水表面来不及被掩埋就与其他链的疏水表面碰撞结合。有意思的是包涵体不全是坏消息。首先包涵体蛋白容易被高浓度变性剂溶解复性后可以得到纯度较高的目标蛋白其次包涵体的形成可以保护蛋白酶防止目标蛋白被降解最后在发酵生产中包涵体往往是高密度发酵的高产形态。但如果你需要的是可溶性活性蛋白控制包涵体形成的关键策略就是降低翻译速度、优化折叠环境。我的经验是把诱导温度从37℃降到25℃、IPTG浓度从0.5 mM降到0.05 mM、在诱导前添加0.2 M山梨醇和0.5 M甘氨酸作为渗透压保护剂通常就能让相当一部分蛋白留在可溶部分。这套组合我用了很多次成功率远高于单独低温诱导。4.3 二硫键折叠的限制还原性细胞质的天然短板大肠杆菌细胞质是强还原环境主要是因为有硫氧还蛋白还原酶TrxA和谷氧还蛋白系统维持细胞质内巯基处于还原态。这个环境对含有二硫键的蛋白是灾难——新生肽链里的半胱氨酸会被还原无法氧化形成正确保健异构体。应对方案通常是导入氧化性的周质空间路径使用带信号肽的载体如PelB、OmpA引导蛋白进入周质空间那里有DsbA和DsbC等二硫键异构酶能够帮助二硫键形成和重排。但周质空间的体积很小外源蛋白高表达很容易超出其容量导致蛋白积聚在细胞周质并诱导压力反应。另一个常用方法是改造大肠杆菌宿主如Origami、Rosetta-gami突变trxB和gor基因后细胞质呈氧化性可让二硫键在细胞质内形成。但代价是生长变慢、转化效率低。我试过用Origami表达一个含4对二硫键的小分子抗体片段可溶性部分确实能检测到二硫键正确连接的物种但总产量比BL21低了大约一个数量级。所以用这类菌株前最好先评估产量损失是否可接受。4.4 折叠优化实操共表达伴侣、融合标签、低温补料融合标签是提高折叠准确性的经典招数。GST标签本身具有二聚化结构可以促进融合蛋白二聚化和折叠MBP是极好的可溶性伴侣其强折叠特性可以将目标蛋白拽进正确构象NusA和SUMO标签同样可以增加可溶性。其中SUMO标签蛋白酶切位点特异性好常用于需要切除标签的样品制备。另一种更偏精细化的操作是分段诱导或脉冲诱导。先让细胞在较低温度下适应一会儿然后非常缓慢地加入诱导剂比如通过流加泵在一个小时内逐步加完让折叠系统逐步响应。这个过程可以有效缓解爆发式转录翻译导致的折叠失衡。我在制备一些更容易聚集的激酶结构域时采用这种方式后可溶性蛋白量反而比常规一次加IPTG高出一倍以上。还有一个容易被忽视的点培养基中的微量元素和辅因子对折叠至关重要。锌指蛋白类的目标蛋白需要Zn2缺锌就是不可溶的垃圾铁硫簇蛋白需要Fe2和S2-的供给。合适浓度的硫酸锌、硫酸亚铁添加有时候比任何表达策略都有用。5. 常见问题与排查技巧实录踩过的坑比优化手册更有价值5.1 无明显诱导带先检查转录再检查翻译如果跑了胶发现加了诱导剂和没加一样蛋白质没有明显增加先别急着怀疑蛋白降解按以下优先级排查质粒是否完整重新测序确认目标基因在正确读框内尤其是起始密码子周围是否有意外突变。转录是否发生抽RNA做Northern或RT-PCR看看目标基因有没有mRNA。如果mRNA都没有问题就在启动子诱导环节——可能是诱导剂失效、lacI突变、或者碳源调控干扰。翻译是否启动如果mRNA有但蛋白无检测SD序列和起始密码子是否被二级结构遮蔽考虑改用RBS计算器重新设计。这中间最容易迷惑人的是诱导剂失效。很多实验室IPTG是提前配好的保存时间超过一年或反复冻融后活性下降导致诱导响应全面变弱。我习惯每次做大规模表达前先用一个已知高表达的质粒做阳性对照几十块钱的成本能省下非常多盲调时间。5.2 蛋白截短与降解杂质蛋白是从哪来的目标蛋白带点杂带很常见但如果出现明显低于目标分子量的主带就要怀疑蛋白水解。多数情况是E. coli的Lon、OmpT等蛋白酶切掉了外源蛋白的柔性区域。注意OmpT是外膜蛋白酶在细胞裂解时释放出来如果你的目标蛋白含碱性残基密集区它很容易被切割。解决思路有三个一是换用蛋白酶缺陷型宿主BL21(DE3)本身是lon和ompT缺陷的所以这步多数人已经绕过了二是优化裂解条件溶菌酶浓度要适中避免机械剪切过于剧烈裂解后尽快加蛋白酶抑制剂PMSF或EDTA按蛋白酶种类选择三是把目标蛋白定位到周质空间或颗粒体有些蛋白在特定区室就不容易被降解。另一个截短的常见原因是翻译提前终止特别是稀有密码子集中在某段区域的时候。如果你观察到的杂带大小很整齐比如都在某个位置断开而不是弥散优先怀疑密码子问题。用在线工具分析编码序列中AGA/AGG/AGR等稀有密码子的聚类情况如果是连续两个以上出现说明很可能是核糖体停滞导致提前终止。5.3 包涵体复性从蛋白质坨子到活性蛋白的工艺化路径如果包涵体已经形成又要复性拿回有活性蛋白流程基本上是破碎菌体低速离心收集包涵体沉淀用含Triton X-100和EDTA的洗涤液多次清洗去除膜脂和杂蛋白。用高浓度变性剂溶解包涵体最常用是8 M尿素或6 M盐酸胍。尿素是温和变性剂适合含二硫键蛋白的复性后续盐酸胍变性更完全。复性方法是关键。稀释复性最简单但蛋白容易重新聚集透析复性速度慢可控层析复性绑定到Ni柱上再梯度去除变性剂效果好但工艺复杂。我比较推荐先用微量筛选法确定一个蛋白浓度 vs 复性缓冲液的窗口再放大。复性缓冲液里必须包含氧化还原对比如还原型谷胱甘肽GSH和氧化型谷胱甘肽GSSG的摩尔比用于二硫键形成和异构化。一个常见的复性误区是蛋白浓度越低越好。确实低浓度能减少聚集但是过低浓度导致得率惨淡。通常建议复性时的蛋白浓度在0.1到1 mg/mL之间具体需要通过梯度实验找到一个平衡点。我做过一个含11对二硫键的蛋白复性时蛋白浓度超过1.5 mg/mL几乎100%沉淀降到0.3 mg/mL加精氨酸到手活性能恢复到天然状态的70%左右。精氨酸是一个非常好用的聚集抑制剂抑制分子间疏水相互作用不会过多干扰折叠平衡。5.4 毒性蛋白表达策略如何表达细胞一看到就想自杀的蛋白表达膜蛋白、核酸酶、抗菌肽这类毒性蛋白最大的挑战是在诱导之前细胞就已经撑不住。策略通常分成防渗漏和快收获两条线防渗漏使用pLysS/pLysE菌株压制T7渗漏用pBAD或L-arabinose系统替代IPTG诱导在培养基中加入1%葡萄糖抑制lac启动子的基底转录或者使用冷敏突变宿主低温下转录活性极低。快收获优化诱导后的采样时间。有些毒性蛋白表达了30分钟就开始引起细胞裂解这时必须先收获不要贪产量。另一个思路是采用分泌型表达用N端信号肽把蛋白导向周质空间或细胞外培养基降低胞内毒性。抗菌肽类常用融合蛋白策略融合到带负电的蛋白如噬菌体T7基因9蛋白上中和其碱性毒性区域表达结束后化学裂解或酶切释放。我试过表达一种对大肠杆菌有极强杀灭作用的小肽直接用pET载体结果转化板一个克隆都不长。后来换成pBAD质粒、阿拉伯糖浓度降到0.002%的时候才长出克隆并诱导成功。这说明毒性蛋白表达关键是让宿主在你想要的时刻之前忘记这个基因的存在。5.5 排查技巧速查表现象可能原因优先措施诱导后完全无带诱导剂失效、质粒错误阳性对照质粒做对照重新测序只有少量包涵体折叠速度跟不上降低IPTG、低温诱导、共表达伴侣大量包涵体但可溶部分有活性部分折叠正确包涵体回收可复性亲和纯化复性流程主带比理论分子量小蛋白降解或翻译提前终止加蛋白酶抑制剂、检查稀有密码子聚类主带比理论分子量大融合标签不完全切割或共价修饰验证标签序列、优化裂解后处理时间诱导后细胞快速死亡蛋白毒性或过量表达换弱启动子、分泌表达、快速收获写在最后最近几年做原核表达越来越觉得机制理解的回报率很高。你知道了σ因子和启动子间隔的关系就不会去瞎改-35区序列你懂了密码子与tRNA丰度的匹配就不会再因为一段稀有密码子堵死核糖体你明白GroEL折叠桶的ATP依赖性就很难再忽略温度对折叠的影响。我个人做实验的体会是批次记录本上写的不只是条件参数而是每个参数背后的逻辑假设。比如我写25℃诱导6小时心里想的是降低翻译速率、给分子伴侣留时间我写0.05 mM IPTG心里想的是避免转录爆发、维持翻译与折叠耦合同步。把这些机制逻辑写清楚实验失败后回看记录往往一瞬间就能找到偏差的根源。最后再说一个我最近常用的技巧在做大体积发酵前先用96孔板做小规模条件矩阵筛选温度×IPTG×时间×有无伴侣共表达同时测定上清和沉淀的总蛋白图谱。虽然筛选工作量看着大但一套做下来每个蛋白的表达窗口都摸得很清楚放到大发酵罐里一次就成了大半。原核表达不是碰运气它是一项因果链清晰的工程学问题机制理解到位了它就是你手里的工具。
阅读完成 · 觉得有帮助?