KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 15|回复: 0

断网离线生成:云AI隐私五分钟实测

[复制链接]
匿名
匿名  发表于 昨天 17:53 |阅读模式
关掉 Wi-Fi,照样让它生成。

云 AI 的隐私是写在政策里的一句承诺;本地隐私是一个你亲手拨过去的开关。下面是五分钟就能做完的证明,以及一张诚实的对照表。



飞行模式测试,一半应用毫无察觉

开会开到一半,把网络掐掉。一半的应用毫无察觉。

照样能跑的:

- 本地模型上的文字生成——权重在磁盘上,请求发给本机
- 本地模型上的图像生成——运行时打包在内,同一台机器
- 编辑、历史、所有保存的文件——本地数据库、本地文件夹

直接断气的:

- 云端模型——提示词必须传到服务器
- 下载新模型——权重来自模型仓库,一次性
- 许可证续期和应用更新——周期性心跳,里面没有内容

这种分化不是某个功能设计出来的,它是物理:权重躺在你磁盘上的模型,根本没有地方把你的提示词送出去。本文会逐次心跳、诚实地区分这两列。

有一个隐私审计,任何人五分钟就能做,而且不用读任何一份政策文件。在你自己的电脑上装一个 AI 模型,让它生成点东西。然后关掉 Wi-Fi,再问一次。如果回答照样流式吐出来,你刚刚就证明了你的提示词去了哪儿:哪儿也没去。

这个证明,就是两种 AI 隐私之间的差别。云隐私是写在一份文档里的承诺,其中有些文档确实写得很好。本地隐私是一条物理性质,你随时可以亲手检验。本文带你走完这个测试,公允地读一读云端的小字条款,然后画出大多数隐私贴子跳过的那部分:一张诚实的地图,标明一个真实 AI 应用里,哪些路径在你机器上,哪些从来就不在。

云隐私是承诺,本地隐私是可检验的事实

云 AI 服务给你的每一项保证,都有一个共同的结构弱点:它描述的是你永远看不到的服务器上的行为。公司可能完全履约,你仍然无法核查。你能做的只是收集承诺,而机构们清楚这有多脆弱。思科的数据隐私基准研究显示,27% 的组织曾在一段时间内干脆禁用生成式 AI,63% 限制员工能输入什么数据,还有 48% 的用户承认,照样把非公开的公司信息塞进了这些工具。

禁用是一种粗暴的回答,针对的却是一个真问题:怎么让人在不能出门的材料上用 AI?一份保密协议下的合同。一段病历。一个还没发布的产品。对这类材料,"我们有严格的留存政策"和"数据根本没有出路",是两种不同性质的回答。我们之前写过消费级聊天机器人怎么处理你们的对话;短答案是,默认设置并不奖励你,值得去翻设置。

跑在你自己硬件上的模型,改变的是认知方式,而不只是风险等级。"你的提示词从不离开这台机器"这句话,从营销话术变成了可证伪的命题。你可以断掉网络,看着这句话活下来。没有任何云服务能以任何价格给你这个实验,因为他们的产品在线路另一头。



五分钟走完的操作流程

下面是完整操作流程,写出来是为了让你自己复现,而不是凭一张截图就相信。

第一步:把一个模型弄到磁盘上。先装一个本地运行时,在还连着网的时候把模型拉下来。Ollama 是常见选择,像我们自己这样的应用会把它打包进去,点一下就行。这次下载是这些权重最后一次碰网络:一个 12B 文本模型大约 8 GB 文件,需要 16 GB 内存;小一点的 3B 或 4B 模型在 8 GB 内存里也能跑得很欢。我们另有一篇内存与显存指南,把模型大小对应到硬件。

第二步:开着网生成一次。这是为了确认模型能跑起来、并把它预热进内存,好让离线那次是公平对比。

第三步:掐断所有连接。笔记本开飞行模式,或者关掉 Wi-Fi 再拔掉网线。要在使用中途拔——重点是不给应用任何提前准备的机会。

第四步:再生成一次,而且让内容长得敏感一点。粘一条假的合同条款,或者一段编出来的病历。回答以和刚才一样的速度流式吐出来,因为这个请求发给的是你自己机器上的服务器,由读自你磁盘的权重回答。Ollama 自己的问答页把底层事实说得很直白:Ollama 在本地运行,你在本地跑的时候,我们看不到你的提示词和数据。飞行模式测试,就是你去检验这句话、而不是引用它的方式。

怀疑论者可以不费什么劲再往下挖一层。保持联网,开一个连接监视器(Mac 上的 Little Snitch,或者一个列着开放套接字的普通终端),看生成过程中运行时在做什么。一次本地推理调用,是发给 127.0.0.1 的请求——这个地址的意思是这台机器自己。去往这个地址的流量根本不会碰到你的网卡,这就是为什么在你碰 Wi-Fi 开关之前测试就已经成立了。飞行模式那版,只是一个不需要工具、也不需要你信任自己读包日志能力的演示。

你最后拿到的不是一种隐私的感觉,而是一个观察到的事实:网络死掉的情况下,提示词和输出没有任何路径离开这台机器。这个事实对你在这条路径上跑的每一次生成都成立,无论联网与否。它还能叠加:同一个测试覆盖本地图像模型、本地语音模型,以及任何权重躺在你磁盘上的东西。一个开关,审计一整家。

云端小字条款,比名声要好

诚实地谈本地 AI,就必须诚实地谈云端 AI;而云端公开发布的条款,比大多数人以为的要好。OpenAI 的 API 数据控制写明,API 数据默认不用于训练其模型,滥用监控日志最多保留 30 天,经批准的组织还可以申请零留存安排。Anthropic 的 API 留存页走得更远:对话内容默认根本不保留。

教训藏在例外里。Anthropic 最新的一批模型被划为"受覆盖模型",要求保留 30 天,并被完全排除在零留存安排之外。Google 的 Gemini API 条款按付费与否切开:付费用量不用于改进产品,而免费层会——包括人工审阅——条款里警告说,不要向免费服务提交敏感、机密或个人信息。同一个产品、同一个输入框,隐私取决于你用的是哪一份配额。

我们自己应用用来做云端生成的那些托管方,也遵循同样的不均匀模式。Replicate 默认在大约一小时后删除 API 预测的输入和输出,这是全行业公布过的最紧的窗口之一,但通过它网站做的预测却无限期保留。Runware 的隐私声明承诺只在必要期间保留信息,却没有公布推理数据的具体窗口,所以诚实的读法是:它没承诺任何数字。

政策之上还有比厂商更大的力量。在一起版权诉讼中,当法院命令 OpenAI 保存消费者聊天记录时,那些用户以为已经删掉的对话被保留了数月,不管隐私页写了什么。我们详细写过那一集。厂商并不撒谎,厂商只是对坐在自己服务器上的数据没有最终决定权——从来没有哪家有。

各家厂商就你的提示词公开发布了什么:

OpenAI API|默认不用 API 数据训练;滥用监控日志最多留 30 天|需要信任
Anthropic API|默认不留存内容;受覆盖模型要求留 30 天|需要信任
Google Gemini API|付费层不用于改进产品;免费层会,含人工审阅|需要信任
Replicate API|预测输入输出默认约一小时后删除|需要信任
Runware|隐私声明未给推理输入输出设具体窗口|需要信任
自己磁盘上的模型|没有什么可留存,因为什么都没发出去|可以亲手检验

以上是各家自己公开发布文件的摘要,正文里都有链接。最后一列才是重点:云端每一行,无论多合理,都在请你信任;只有本地那一行,你在线路这一头就能验证。

这一切都不是指控,而是工具的本性。那张表里的每一行都是一份可以被修订的文件,带着厂商后来自己加上的例外,描述着你无法检视的机器。政策是别人桌上的一个旋钮。对大多数活儿来说,这笔交易很划算,云端最大的模型确实更好。问题从来不是云坏本地好,而是你的哪些任务容得下一句承诺,哪些需要一个证明。

本地是一条路径的属性,不是一个应用的属性

这部分厂商往往会搅浑,所以我们就自己的产品说精确点。大多数正经 AI 应用,包括 CSuite,都是混合体。一个界面前端,背后同时排着跑在 Replicate 和 Runware 上的云端模型,以及跑在打包运行时里的本地模型:一个 Ollama 服务器管文字,一个管图像,一个 HuggingFace 运行时跑小的文字和语音模型,一个 Stable Diffusion C++ 服务器跑图像和视频,各自监听自己的本地端口。选择器看上去是统一的,每一行背后的物理却不是。一套代码库怎么同时跟所有这些对话,另有一篇专门讲。

所以,"你的数据留在你设备上"这种话,不加限定词是没有意义的。诚实的句子要说出路径:在本地运行时上的生成留在机器上;在云端模型上的生成会走出去,适用那家厂商的政策。一张诚实的地图还要标出,哪怕你从不碰云端模型、应用仍然存在的那些网络调用——因为一个声称零流量的应用,要么是个镇纸,要么在撒谎。

一个混合 AI 应用的边界地图:

留在你机器上的:

- 本地模型文字生成——提示词发给本机服务器,权重从磁盘应答,输出写进你的文件夹
- 本地模型图像生成——同一个循环,走打包的图像运行时;这张图除了你的机器哪儿也不存在
- 你的文件、编辑、历史——生成落在你选的文件夹里,编辑历史存在本地数据库里

会越过网络的:

- 任何云端模型——提示词、附件、成品输出全部去往厂商,适用其政策
- 下载模型——从仓库一次性拉取;暴露的是你拉了哪个模型,不是你拿它做什么
- 许可证检查——周期性心跳,带着许可证密钥和机器 ID;没有提示词,没有输出
- 更新检查和实时定价——小小的版本号和价格查询;离线时都安静失败,不带内容

这是 CSuite 自己的路径,诚实地画出来。上一组是飞行模式测试证明的部分,下一组是这个应用无论如何都会发出的每一个网络调用,以及各自带了什么。

那三个后台调用值得用大白话讲清楚。下载模型,告诉仓库你拉了哪个模型,就一次。许可证检查发一个密钥和机器标识,好让付费激活能用;它不带你打的任何字。更新器和价格查询,向服务器要一个版本号和一个美元数字。它们在你离线时都安静失败,没有一个碰提示词或输出。这才是诚实的边界长什么样:不是永不上网,而是你的内容没有任何出路,其余每一个包都点名。

这张地图可以推广到你正在评估的任何工具,这才是真正把它内化于心的理由。当一个厂商说端侧时,问清楚这个词覆盖了哪些路径,然后用同一个开关去检验答案:加载那个本地功能,切断网络,看什么还在工作。一个悄悄停掉的功能,从来就不是本地的。一个答不出自己哪些功能会停的厂商,自己都没画过这张图,而这份沉默本身也是信息。

离线也有诚实的边界,包括一个时钟

飞行模式测试证明的是一条边界,不是一种生活方式,而这条边界有真实的边缘。第一个边缘是时钟。带许可证的应用会时不时在线验证授权;就 CSuite 而言,一张激活收据在纯离线状态下大约两周内有效,之后应用需要联网续期,生成会暂停直到续上。你的文件和历史无论如何都还能读。如果你的工作要求离线好几个月,那是在为任何付费工具——包括我们的——掏钱之前就要核对的要求。

第二个边缘是能力。笔记本上的 12B 模型,写草稿、做摘要、改写、答问题都好到很多人日常工作里察觉不到差别,本地图像模型也能出真正可用的图。但前沿仍然在云端,差距在硬核推理和打磨度上会显现,有些活儿——比如长时长高分辨率视频——实际上就是云端的活儿。第三个边缘是配置税:权重必须在联网时下载,占实实在在的磁盘空间,而你的内存给到底什么能跑画了一道硬上限。

这些边缘都不削弱那个证明,它们只是圈定它的范围。本地 AI 不是一切活儿里更好的工具,它是那批材料不能出门的工作里唯一能用的工具,而飞行模式测试,就是你确认那批活儿确实被覆盖住的方式。

按泄露代价给你的活儿分堆

实操结论是一条分拣规则,而不是选边站队。看每一项 AI 任务,问自己:如果提示词和输出出现在别人的服务器上,代价是什么?博客草稿、情绪板、反正你打算开源的代码——答案是没代价;哪个模型最好就用哪个,管它跑在哪儿。合同、诊断、还没发布的设计——把这条工作路接到本地路径上,跑一次飞行模式测试,让这份保证成为你亲眼观察到的,而不是任何人——包括我们——口头告诉你的。

这个测试,值得每台机器跑一次、每个应用跑一次,就像你真的恢复一次备份来测试它那样。它花五分钟,不需要专业知识,它把这个行业里最含糊的那个词——私密——变成了一件你在关掉无线电的情况下亲眼看着发生的事。

隐私政策告诉你一家公司打算做什么。一块死掉的网卡告诉你物理上可能什么。对最重要的那些活儿,用物理买保证,别用散文。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:27 , Processed in 0.051590 second(s), 20 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表