第明发展至今所有有价值的、经过验证的知识和经验,都结构化地存储在里面。
引擎是大模型——能够根据当前的问题,从数据库中快速调取相关的知识片段,进行推理、综合和预测,给出有依据的答案和建议。
两者结合在一起,就是一个真正站在巨人肩膀上的智能体。”
陆迪峰的手指轻轻敲击着桌面,这是他思考时的习惯性动作。
“这个方向,现在全世界都在投。
OpenAI、le、Meta、国内的几家大厂——都在砸钱建模型、囤算力、抢数据。
但据我所知,目前还没有哪一家真正找到了可持续的商业闭环。
投入很大,收益却不乐观。”
“那是因为他们的模型是悬在半空中的。”苏酥雪说,“他们的训练数据来自互联网——网页、论坛、论文、书籍——这些数据确实是人类知识的集合,但它们是被动采集的,与真实世界的物理反馈是脱节的。
一个模型可以写出文采飞扬的文章,可以编出逻辑严密的代码,但它不知道一台机器坏了该怎么修,不知道一种新材料在高温下会有什么表现,不知道一个战术决策在实战中会产生什么后果。
因为它没有自己的‘手’和‘脚’,没有与物理世界直接交互的通道。”
“而我们不一样。”
“对。
我们有智能产线、有战斗单元、有太空实验平台——这些都是与物理世界直接交互的通道。
我们的模型可以从这些通道中获得实时的、真实的反馈数据。
它预测一个工艺参数,智能产线会告诉它这个参数实际加工出来的产品质量如何;它制定一个战术方案,战斗单元会告诉它这个方案在实战中的效果如何;它设计一个轨道机动方案,织女卫星会告诉它这个方案的燃料消耗和到达精度如何。
这种闭环反馈,是那些只靠互联网数据训练的模型永远无法获得的。”
陆迪峰站起身,走到窗前,背对着苏酥雪,沉默了很久。
窗外,矿区的景色在午后的阳光下一览无余——智能车间的蓝色屋顶在阳光下泛着光泽,远处的风力发电机叶片在缓缓转动,更远处的山脊线上,隐约可以看到正在建设中的光电膜测试场的脚手架。
他转过身,问道:“建这个认知引擎,需要多大的投入?”
“初期投入主要包括三块。”苏酥雪显然已经做过详细的测算,“算力基础设施,需要建设一座新的数据中心,配备至少五千张以上的高性能计算卡,总投资大约在三到四亿元。
数据工程,需要对现有的所有业务数据进行清洗、标注和结构化整理,同时还要系统性地录入人类文明在各个领域的经典知识和实践经验,这部分的人力投入很大,需要组建一支至少五十人的数据工程师团队。
模型研发,需要招聘和培养一批在深度学习、自然语言处理和强化学习领域有深厚积累的研究员,核心团队至少需要二十到三十人。”
“每年的运营成本呢?”
“数据中心建成后,每年的电费和运维成本大约在明知识的系统性汇编——从牛顿的《自然哲学的数学原理》到爱因斯坦的广义相对论论文,从瓦特的蒸汽机图纸到冯·诺依曼的计算机架构笔记,从《考工记》中的冶金配方到《天工开物》中的农业技术,从克劳塞维茨的《战争论》到孙子兵法。
所有这些人类在漫长历史中积累的、经过实践检验的知识,都应当被结构化地收录进来,成为认知引擎的养料。”
这段话让陆迪峰感到一种沉甸甸的分量。
他知道,苏酥雪所描述的,不仅仅是一个技术项目,更是一项文明级别的工程。
如果这个认知引擎真的能够建成,它将不仅仅是一个商业工具,更是一个能够传承和延续人类智慧的数字载体。
但同时,他也清醒地认识到,这项工程的难度和风险都是空前的。
数据的采集和整理本身就是一项浩大的工程——人类几千年来积累的知识浩如烟海,如何筛选、如何分类、如何结构化、如何确保准确性和完整性,每一个环节都是巨大的挑战。
而模型的训练和部署更是充满了不确定性——大模型的 行为 往往难以预测,即使是设计者也无法完全理解其内部的运作机制。
苏酥雪提到的“规则感知模块”能否有效地约束模型的行为,目前还只是一个理论上的设想,没有经过实践的验证。
他在建议书的最后一页空白处,写下了一行批注:“这是一条正确的路,也是一条艰难的路。
但只要方向是对的,再难也值得走下去。”
几天后,苏酥雪再次来到矿区,这次她带来了一份更加详细的实施方案,以及一个让陆迪峰感到不安的附加议题。
本章未完,请翻下一页继续阅读.........
引擎是大模型——能够根据当前的问题,从数据库中快速调取相关的知识片段,进行推理、综合和预测,给出有依据的答案和建议。
两者结合在一起,就是一个真正站在巨人肩膀上的智能体。”
陆迪峰的手指轻轻敲击着桌面,这是他思考时的习惯性动作。
“这个方向,现在全世界都在投。
OpenAI、le、Meta、国内的几家大厂——都在砸钱建模型、囤算力、抢数据。
但据我所知,目前还没有哪一家真正找到了可持续的商业闭环。
投入很大,收益却不乐观。”
“那是因为他们的模型是悬在半空中的。”苏酥雪说,“他们的训练数据来自互联网——网页、论坛、论文、书籍——这些数据确实是人类知识的集合,但它们是被动采集的,与真实世界的物理反馈是脱节的。
一个模型可以写出文采飞扬的文章,可以编出逻辑严密的代码,但它不知道一台机器坏了该怎么修,不知道一种新材料在高温下会有什么表现,不知道一个战术决策在实战中会产生什么后果。
因为它没有自己的‘手’和‘脚’,没有与物理世界直接交互的通道。”
“而我们不一样。”
“对。
我们有智能产线、有战斗单元、有太空实验平台——这些都是与物理世界直接交互的通道。
我们的模型可以从这些通道中获得实时的、真实的反馈数据。
它预测一个工艺参数,智能产线会告诉它这个参数实际加工出来的产品质量如何;它制定一个战术方案,战斗单元会告诉它这个方案在实战中的效果如何;它设计一个轨道机动方案,织女卫星会告诉它这个方案的燃料消耗和到达精度如何。
这种闭环反馈,是那些只靠互联网数据训练的模型永远无法获得的。”
陆迪峰站起身,走到窗前,背对着苏酥雪,沉默了很久。
窗外,矿区的景色在午后的阳光下一览无余——智能车间的蓝色屋顶在阳光下泛着光泽,远处的风力发电机叶片在缓缓转动,更远处的山脊线上,隐约可以看到正在建设中的光电膜测试场的脚手架。
他转过身,问道:“建这个认知引擎,需要多大的投入?”
“初期投入主要包括三块。”苏酥雪显然已经做过详细的测算,“算力基础设施,需要建设一座新的数据中心,配备至少五千张以上的高性能计算卡,总投资大约在三到四亿元。
数据工程,需要对现有的所有业务数据进行清洗、标注和结构化整理,同时还要系统性地录入人类文明在各个领域的经典知识和实践经验,这部分的人力投入很大,需要组建一支至少五十人的数据工程师团队。
模型研发,需要招聘和培养一批在深度学习、自然语言处理和强化学习领域有深厚积累的研究员,核心团队至少需要二十到三十人。”
“每年的运营成本呢?”
“数据中心建成后,每年的电费和运维成本大约在明知识的系统性汇编——从牛顿的《自然哲学的数学原理》到爱因斯坦的广义相对论论文,从瓦特的蒸汽机图纸到冯·诺依曼的计算机架构笔记,从《考工记》中的冶金配方到《天工开物》中的农业技术,从克劳塞维茨的《战争论》到孙子兵法。
所有这些人类在漫长历史中积累的、经过实践检验的知识,都应当被结构化地收录进来,成为认知引擎的养料。”
这段话让陆迪峰感到一种沉甸甸的分量。
他知道,苏酥雪所描述的,不仅仅是一个技术项目,更是一项文明级别的工程。
如果这个认知引擎真的能够建成,它将不仅仅是一个商业工具,更是一个能够传承和延续人类智慧的数字载体。
但同时,他也清醒地认识到,这项工程的难度和风险都是空前的。
数据的采集和整理本身就是一项浩大的工程——人类几千年来积累的知识浩如烟海,如何筛选、如何分类、如何结构化、如何确保准确性和完整性,每一个环节都是巨大的挑战。
而模型的训练和部署更是充满了不确定性——大模型的 行为 往往难以预测,即使是设计者也无法完全理解其内部的运作机制。
苏酥雪提到的“规则感知模块”能否有效地约束模型的行为,目前还只是一个理论上的设想,没有经过实践的验证。
他在建议书的最后一页空白处,写下了一行批注:“这是一条正确的路,也是一条艰难的路。
但只要方向是对的,再难也值得走下去。”
几天后,苏酥雪再次来到矿区,这次她带来了一份更加详细的实施方案,以及一个让陆迪峰感到不安的附加议题。
本章未完,请翻下一页继续阅读.........