最近测试了一下:让大模型完全不调用 Python、计算器或其他工具,直接“心算”一道 1236 位超长整数加法。
目前我的实测情况:
- Sol Max:约 6 分钟,大部分情况下能算对;偶尔会出现前 1000 多位正确,后面只错几位的情况。
- Terra Max:约 12 分钟。
- Luna Max:约 12~30 分钟,目前测试基本都会出现错误,没有答对记录。
这其实不只是测试“会不会加法”。
加法规则很简单,但面对 1236 位数字,模型需要连续保持:
数字对齐 → 当前位相加 → 处理进位 → 继续下一位 → 完整输出
中间只要一次错位、漏数字、进位错误,最终答案就可能出错。
所以这个测试更像是在测:
大模型能不能长时间稳定执行一个非常简单、但要求绝对精确的串行算法。
测试题
提示词:
加法计算下,绝对不能调用工具,直接输出结果:
533831315817131646688134465820745010627063093403070480878192086366001174044560286258135327282181498303188090834456676599268305529936706878244141675662944488565867808028835857631943293904794527036456603050087548044677564049289409927976930081590584602582661326782024273282045227867162696237644036866300421203318303860847689012841355401834585000654481412898946693800148249837894463125791026112838028714209026410419731659803900486235676493119224676799796423802680250776854580902070171659757828703214662645853614156874992444823470053001666303911173641155492732994238176141699634861257548984343726535628625519131528202814132846811738676580721749528607038879933887181282494699666487744440098051171604020265555020887485303108462245839040987684647222623379795289086860744193728544166147838451986847995442622586089788231590091367783484742315438404163840791549810257711030998525290421526684026192958105304144078610672705056829511443795519200904171454654207220449462448159514739973894098388761202504973710434742780872007419678709178462593186354780806985761605670137362289353595470312899359789383281155511416608455039121853748829171962422206505228021196801212737350918183938387550133798139580495599239513493347244675140243701978894806863042231107713
+
444271879161242926991703179206992329900562886140790613050414097112785124097982697798255496176568564082500432562801943115495813129783257922460446843532641881315617500077316471785726401238367664590413993318235528136591282925419304102732115783266378656414384950344003597093345342101762420953390134924420764677013504362771413511697153326204971015584795505458689467269221927219706123113049242260247110549985718912155037799690221927277946402909516886778931513743908623670626351081921166890177320918404521045153234806323074739943879372783636676562134745546009112266589603423424878268838081336971474893947778697529381805328525225657469516447627395189305787379599025233990545856151472670691587920411261633180421993160230082218933720350489062501190069794299208863281476976041515929186775554221373892625509737802231778399450336420123375535766437035325744713319208358656378373659371430603832113982364946726044081181255926376989001882010689943201519403708600376134292960638360610958911112695309414456219144231597059619231616338676498857514320414881522483790082250574084638890347091722493324033525996938442086094648023052417772148795152236842422566990420078271511854940588647237932579425990101740616417659803430483314201082187496750831350082963009353
正确答案
978103194978374573679837645027737340527625979543861093928606183478786298142542984056390823458750062385688523397258619714764118659719964800704588519195586369881485308106152329417669695143162191626870596368323076181268846974708714030709045864856963258997046277126027870375390569968925117191034171790721185880331808223619102524538508728039556016239276918357636161069370177057600586238840268373085139264194745322574769459494122413513622896028741563578727937546588874447480931983991338549935149621619183691006848963198067184767349425785302980473308386701501845260827779565124513130095630321315201429576404216660910008142658072469208193028349144717912826259532912415273040555817960415131685971582865653445977014047715385327395966189530050185837292417679004152368337720235244473352923392673360740620952360388321566631040427787906860278081875439489585504869018616367409372184661852130516140175323052030188159791928631433818513325806209144105690858362807596583755408797875350932805211084070616961192854666339840491239036017385677320107506769662329469551687920711446928243942562035392683822909278093953502703103062174271520977967114659048927795011616879484249205858772585625482713224129682236215657173296777727989341325889475645638213125194117066
测试时一定要禁止模型调用工具,否则直接交给 Python 或计算器计算,就失去测试意义了。
快速检查时可以先对比答案开头和结尾几十位;如果要判断是否完全正确,则需要全文逐位比对。
需要注意:大模型本身并不是任意精度计算器,一次算对不代表每次都能算对。真正值得观察的,是不同模型在这种“超长、串行、零容错”任务上的稳定性。